{"id":16443,"date":"2026-07-31T09:52:10","date_gmt":"2026-07-31T07:52:10","guid":{"rendered":"https:\/\/www.proefschriftmaken.nl\/portfolio\/gijs-wijngaard\/"},"modified":"2026-07-31T09:52:18","modified_gmt":"2026-07-31T07:52:18","slug":"gijs-wijngaard","status":"publish","type":"us_portfolio","link":"https:\/\/www.proefschriftmaken.nl\/en\/portfolio\/gijs-wijngaard\/","title":{"rendered":"Gijs Wijngaard"},"content":{"rendered":"","protected":true},"excerpt":{"rendered":"","protected":true},"author":7,"featured_media":16444,"comment_status":"closed","ping_status":"closed","template":"","meta":{"_acf_changed":false,"footnotes":""},"us_portfolio_category":[45],"class_list":["post-16443","us_portfolio","type-us_portfolio","status-publish","post-password-required","hentry","us_portfolio_category-new-template"],"acf":{"naam_van_het_proefschift":"DATA AND SEMANTIC REASONING IN AUDIO-LANGUAGE LEARNING","samenvatting":"Dit proefschrift onderzoekt hoe computers kunnen leren om geluid te begrijpen en het te beschrijven met taal, vergelijkbaar met hoe mensen dat doen. Wanneer je bijvoorbeeld een hond hoort blaffen, kun je onmiddellijk herkennen en beschrijven wat het is dat je hoort. Het uiteindelijke doel met dit proefschrift is computersystemen te bouwen en te verbeteren, zodat zij geluiden even goed kunnen herkennen en duiden als de mens.\n\nComputers leren door middel van data. Deze data worden gebruikt om een computer te trainen. Net zoals kinderen die leren door blootgesteld te worden aan voorbeelden, leren deze computersystemen van grote verzamelingen geluiden gekoppeld aan tekst. Het eerste deel van dit werk biedt een uitgebreid overzicht van 69 datasets die in dit vakgebied worden gebruikt, waarbij wordt onderzocht waar ze vandaan komen en wat ze bevatten. Hieruit blijkt dat het merendeel van deze data afkomstig is van platforms zoals YouTube en Freesound. Problemen zijn er ook, zoals aanzienlijke onderlinge overlap, wat een verkeerde indruk kan geven van hoe goed deze systemen daadwerkelijk presteren wanneer ze worden getest.\n\nOm deze dataproblemen te beperken, richt dit proefschrift zich op hoe computers van data leren. Een aanpak is curriculum learning: het model krijgt eerst makkelijke voorbeelden te zien en daarna geleidelijk moeilijkere. Dit verbetert leerresultaten bij het beantwoorden van vragen over geluiden. Andere technieken, zoals het zorgvuldig uitfilteren van dubbele data en het beperken van oververtegenwoordigde geluidscategorie\u00ebn, verbeteren de prestaties verder.\n\nDe derde hoofdbijdrage haalt inspiratie uit hoe mensen geluiden waarnemen en beschrijven. Wanneer mensen beschrijven wat ze horen, organiseren ze hun beschrijvingen van nature rond kernvragen: Wie of wat maakt het geluid? Hoe wordt het geproduceerd? Waar en wanneer gebeurt het? Cognitief neurowetenschappelijk onderzoek suggereert dat het herkennen van geluidsbronnen, het begrijpen hoe geluiden worden gemaakt, en het plaatsen ervan in context allemaal specifieke mentale processen zijn. Voortbouwend op dit inzicht werd het model AudSemThinker ontwikkeld. Dit systeem redeneert expliciet over deze \u201csemantische\u201d aspecten van geluid voordat het zijn definitieve antwoord genereert, vergelijkbaar met hoe een persoon zou kunnen nadkenken over wat hij hoort alvorens te spreken. Om dit systeem te trainen, werd een volledig nieuwe dataset genaamd AudSem gecre\u00eberd uit YouTube video ondertitels, zorgvuldig ontworpen om overlap met bestaande data te vermijden. Het resulterende model presteerde beter dan bijna alle vergelijkbare systemen op meerdere benchmarks.\n\nHet verbeteren van deze systemen vereist ook betere manieren om ze te evalueren. Traditionele evaluatiemethoden richten zich vaak op oppervlakkige woordovereenkomsten. De vierde bijdrage introduceert een nieuwe evaluatiemethode genaamd ACES, die door computers gegenereerde beschrijvingen beoordeelt op basis van of ze de essenti\u00eble semantische elementen van het geluid vastleggen. In plaats van simpelweg woorden te vergelijken, onderzoekt ACES of beschrijvingen geluidsentiteiten, acties en andere contexten correct identificeren. De gedachte erachter is dat deze metriek nauwer aansluit bij hoe mensen de kwaliteit van audiobeschrijvingen beoordelen.\n\nDe laatste bijdrage hanteert een andere benadering van het herkennen van audio. In plaats van een enkel model, worden er meerdere gespecialiseerde systemen gecombineerd. Vergelijkbaar met hoe een team van menselijke experts met verschillende specialisaties complexe problemen kan oplossen door samen te werken, co\u00f6rdineert het AudioToolAgent-framework verschillende computerprogramma\u2019s. Een centraal systeem fungeert als co\u00f6rdinator en beslist welke gespecialiseerde tools geraadpleegd moeten worden voor verschillende aspecten voor het herkennen van de audio, waarbij de co\u00f6rdinator zelf niet de audio kan luisteren. Bij het verwerken van audio die spraak bevat, delegeert de co\u00f6rdinator transcriptie aan een spraakherkenningsspecialist, terwijl hij andere tools raadpleegt voor omgevingsgeluiden of muziek. Door samen te werken met verschillende modellen, en een overkoepelende model alle denkstappen te laten maken, behaalt deze methode de beste resultaten op meerdere uitdagende evaluaties. Een groot voordeel hiervan is de besparing in rekentijd en middelen; bestaande modellen worden hergebruikt in plaats van het laten leren van een geheel nieuw model.\n\nGezamenlijk bevorderen deze bijdragen het vakgebied van de combinatie van audio en taal, door: (1) belangrijke uitdagingen in datakwaliteit en beschikbaarheid te duiden; (2) op mensen ge\u00efnspireerde leermethodieken te testen; (3) nieuwe redeneermechanismen op basis van hoe mensen leren te introduceren; (4) betere evaluatiemethoden te ontwikkelen; en (5) aan te tonen hoe geco\u00f6rdineerde specialistische systemen beter kunnen presteren dan enkele modellen. Dit proefschrift maakt computers beter in staat om de rijke wereld van geluid om ons heen te begrijpen en dat te communiceren via natuurlijke taal.","summary":"This dissertation explores how computers can learn to understand sound and describe it using language. The goal is to approach human capabilities. When a person hears a dog barking, they can instantly recognize it and describe what they hear. The research in this dissertation focuses on building and improving computer systems that move toward similar capabilities. The systems analyze which sound is present, what action is involved, where it occurs, and which objects are involved.\n\nThe foundation of teaching computers to understand sound lies in showing them examples. Just as children learn by being exposed to examples and learn by doing, these computer systems learn from large collections of sounds, paired with text descriptions. The first part of this work provides a survey of 69 datasets used in this field and examines where they come from and what they contain. There are challenges in the use of audio data. For example, there is substantial overlap between datasets, which can give a misleading impression of how well these systems perform when tested.\n\nUnderstanding these data problems led to the second contribution: improving the way computers learn from these data. Training a computer system is not simply about showing all available examples at once. Research shows that starting with easier examples and gradually introducing more difficult ones leads to better learning outcomes. This approach, inspired by how curriculum is designed in education, was applied to the task of answering questions about audio. It introduces examples in order of difficulty. Other approaches include filtering out duplicate data and balancing overrepresented sound categories. The resulting system achieved improvements in performance without requiring more computational resources.\n\nThe third major contribution draws inspiration from how humans perceive and describe sounds. When people describe what they hear, they naturally organize their descriptions around key questions: Who or what is making the sound? How is it produced? Where and when is it happening? Cognitive neuroscience research suggests that recognizing sound sources, understanding how sounds are made, and placing them in context involve specific mental processes. Building on this, the AudSemThinker model was developed. AudSemThinker explicitly reasons about these semantic aspects of sound before generating its final answer, which is similar to how a person might think through what they are hearing before speaking. To train AudSemThinker, a completely new dataset called AudSem was created from YouTube video subtitles. It was designed to avoid overlap with existing test sets. The resulting model matches or exceeds the performance of strong existing systems on multiple benchmarks.\n\nImproving these systems also requires better ways to evaluate them. Traditional evaluation methods often focus on word matching. The fourth contribution introduces a new evaluation metric, called ACES, which judges computer-generated descriptions based on whether they capture the essential semantic elements of the sound. Instead of simply comparing words, ACES examines whether descriptions correctly identify sound entities, actions, and other contexts. The idea is that this metric aligns more closely with how humans judge the quality of audio descriptions.\n\nThe final contribution takes a different approach to audio understanding by combining multiple specialized systems. Like how a team of human experts with different specializations can solve problems by collaborating, the AudioToolAgent framework coordinates several specialized computer programs. A central reasoning system acts as a coordinator, deciding which specialized tools to consult for different aspects of an audio task. For example, when processing audio that contains speech, the coordinator delegates transcription to a speech recognition specialist, while consulting other tools for environmental sounds or music. This collaborative approach achieves strong results on multiple challenging benchmarks. It remains modular and cost-effective by reusing existing pre-trained models.\n\nThese contributions advance the field of audio-language learning by: (1) addressing challenges in data quality and availability; (2) improving audio question answering via data-balanced curricula; (3) introducing human-inspired reasoning mechanisms; (4) developing evaluation methods that focus on semantic content; and (5) demonstrating how coordinated specialist systems can outperform single general-purpose models. These developments move computers closer to understanding the acoustic world and communicating that understanding through natural language.","auteur":"Gijs Wijngaard","auteur_slug":"gijs-wijngaard","publicatiedatum":"7 september 2026","taal":"EN","url_flipbook":"https:\/\/ebook.proefschriftmaken.nl\/ebook\/gijswijngaard?iframe=true","url_download_pdf":"https:\/\/ebook.proefschriftmaken.nl\/download\/b29abcd5-6e22-45bb-91db-35f6601d9002\/optimized","url_epub":"","ordernummer":"19148","isbn":"","doi_nummer":"","naam_universiteit":"Universiteit Maastricht","afbeeldingen":16445,"naam_student:":"","binnenwerk":"","universiteit":"Universiteit Maastricht","cover":"","afwerking":"","cover_afwerking":"","design":""},"_links":{"self":[{"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/us_portfolio\/16443","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/us_portfolio"}],"about":[{"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/types\/us_portfolio"}],"author":[{"embeddable":true,"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/users\/7"}],"replies":[{"embeddable":true,"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/comments?post=16443"}],"version-history":[{"count":1,"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/us_portfolio\/16443\/revisions"}],"predecessor-version":[{"id":16446,"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/us_portfolio\/16443\/revisions\/16446"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/media\/16444"}],"wp:attachment":[{"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/media?parent=16443"}],"wp:term":[{"taxonomy":"us_portfolio_category","embeddable":true,"href":"https:\/\/www.proefschriftmaken.nl\/en\/wp-json\/wp\/v2\/us_portfolio_category?post=16443"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}