Multimodaal model
Wat is een multimodaal AI-model?
Een AI-model dat niet alleen tekst, maar ook beeld, geluid of video begrijpt en soms ook maakt.
Gecontroleerd op · 1 bron
Wat het is
Een multimodaal model werkt met meer dan één soort invoer: tekst, afbeeldingen, audio, video. Het kan een foto beschrijven, een grafiek uitleggen, een gesproken vraag beantwoorden of een schets omzetten in een werkende webpagina.
Waar vroeger voor elk soort gegevens een apart model nodig was, zitten die vaardigheden nu steeds vaker in één model, zodat het verbanden kan leggen tussen wat het ziet, hoort en leest.
Een voorbeeld
Je maakt een foto van het bedieningspaneel van een onbekende wasmachine in een vakantiehuisje en vraagt welk programma je moet kiezen voor wol. Het model leest de symbolen en de tekst op de foto en wijst de juiste knop aan.
Waar het tekortschiet
- Het kan details op een beeld verkeerd lezen, zoals kleine tekst, getallen of de telling van objecten.
- Gesproken en visuele invoer kunnen net zo goed verborgen instructies bevatten als tekst.
- Foto's en opnames bevatten vaak meer persoonsgegevens dan je denkt, zoals gezichten, adressen en schermen op de achtergrond.
Waarom het ertoe doet
Multimodale modellen maken AI bruikbaar voor taken waar je vroeger een mens voor nodig had om te kijken of te luisteren, van schadeclaims beoordelen tot toegankelijkheid voor slechtzienden.
In het nieuws
Hangt hiermee samen
Bronnen
- Wikipedia: Multimodal learning en.wikipedia.org
Deze uitleg is geschreven door de redactie van RedFlare en op 25 september 2026 tegen deze bronnen nagelezen.