Multimodale AI-modellen: Welke kunnen beeld, audio en video?

Gepubliceerd in de LLMNet Hub | Laatste update: Juli 2026

De generatieve AI-markt is drastisch verschoven van puur tekstgedreven modellen naar volledig multimodale systemen. Moderne architecturen kunnen gelijktijdig redeneren over tekst, afbeeldingen, audio en video. Dit overzicht belicht op conceptniveau welke bekende modellen welke modaliteiten ondersteunen.

Uitleg van de Modaliteiten

Vergelijkingstabel Bekende Modellen

Model / Serie Tekst Beeld Audio Video
OpenAI GPT-4o Ja Ja Ja (Native) Beperkt (Frames)
Google Gemini 1.5 Pro Ja Ja Ja Ja (Native)
Anthropic Claude 3.5 Sonnet Ja Ja Nee Nee
Meta Llama 3.2 (Vision) Ja Ja Nee Nee

Let op: Ondersteuning voor audio en video verschilt sterk per API-implementatie en of het model input, output of beide betreft. Sommige specificaties zijn gebaseerd op publieke releases en kunnen onderhevig zijn aan updates.