# Multimodale embeddings en CLIP: tekst en beeld verbonden

[Naar de inhoud](#lm-inhoud)Netwerk/NL[EN](/en/)[Hubhub.llmnet.nlModellen vergelijken op taak, taal, kosten en licentie.](https://hub.llmnet.nl/)[Communitycommunity.llmnet.nlPrompttechnieken, patronen en systeemprompts.](https://community.llmnet.nl/)[APIapi.llmnet.nlLLM's robuust in software: rate limits, routing, structured output.](https://api.llmnet.nl/)[Consultancyconsultancy.llmnet.nlAI invoeren in een organisatie, van pilot tot productie.](https://consultancy.llmnet.nl/)[Nieuwsnieuws.llmnet.nlOntwikkelingen in AI, geduid voor Nederland.](https://nieuws.llmnet.nl/)[Benchmarkbenchmark.llmnet.nlZelf meten wat AI-kwaliteit is, voor jouw taken.](https://benchmark.llmnet.nl/)[Vacaturesvacatures.llmnet.nlAI-rollen, salarissen en carrièrepaden in Nederland.](https://vacatures.llmnet.nl/)[Lerenleren.llmnet.nlAI-concepten in gewoon Nederlands, van beginner tot bouwer.](https://leren.llmnet.nl/)[Gidsgids.llmnet.nlAI privé draaien op eigen Mac, pc, NAS of thuisserver.](https://gids.llmnet.nl/)[Directorydirectory.llmnet.nlHet AI-ecosysteem in kaart: tools, modellen, bedrijven.](https://directory.llmnet.nl/)[Radarradar.llmnet.nlSignalen uit X, onderzoek en communities voor indie developers.](https://radar.llmnet.nl/)[llmnet.nl — hoofdsite](https://llmnet.nl/)[](https://x.com/intent/post?url=https%3A%2F%2Fhub.llmnet.nl%2Fmultimodale-embeddings-clip&text=Multimodale%20embeddings%20en%20CLIP%3A%20tekst%20en%20beeld%20verbonden)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fhub.llmnet.nl%2Fmultimodale-embeddings-clip)[](https://www.reddit.com/submit?url=https%3A%2F%2Fhub.llmnet.nl%2Fmultimodale-embeddings-clip&title=Multimodale%20embeddings%20en%20CLIP%3A%20tekst%20en%20beeld%20verbonden)[](#)[](https://x.com/intent/post?url=https%3A%2F%2Fhub.llmnet.nl%2Fmultimodale-embeddings-clip&text=Multimodale%20embeddings%20en%20CLIP%3A%20tekst%20en%20beeld%20verbonden)[](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fhub.llmnet.nl%2Fmultimodale-embeddings-clip)[](https://www.reddit.com/submit?url=https%3A%2F%2Fhub.llmnet.nl%2Fmultimodale-embeddings-clip&title=Multimodale%20embeddings%20en%20CLIP%3A%20tekst%20en%20beeld%20verbonden)[](#)

 
# Multimodale embeddings en CLIP: hoe vectoren tekst en beeld verbinden

 Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini)

 Traditionele zoekmachines en taalmodellen verwerken tekst en beeld via strikt gescheiden pijplijnen. Waar een taalmodel zinnen omzet in dichte numerieke vectoren, werd beeld decennialang geanalyseerd met convolutionele netwerken die enkel getraind waren op vooraf gedefinieerde categorieën. Multimodale embeddings doorbreken deze scheiding fundamenteel. Door zowel tekstuele beschrijvingen als visuele informatie naar één gedeelde meetkundige vectorruimte te projecteren, ontstaat de mogelijkheid om een foto direct te vergelijken met een geschreven zoekopdracht.

 De introductie van CLIP (Contrastive Language-Image Pre-training) door OpenAI in 2021 markeerde het omslagpunt voor dit vakgebied. In plaats van miljoenen handmatig gelabelde afbeeldingen te classificeren, leert een multimodaal embeddingmodel verbanden leggen tussen willekeurige afbeeldingen en bijbehorende beschrijvingen van het openbare web. Wie wil begrijpen hoe moderne visuele zoeksystemen, zero-shot classificatie en multimodale RAG-architecturen werken, moet eerst kijken naar de wiskundige en architectonische basis van deze gedeelde vectorruimtes. Voor een breder perspectief op generative pipelines en generatieve capaciteiten over modaliteiten heen biedt het [overzicht van multimodale AI-modellen](https://hub.llmnet.nl/multimodale-modellen-overzicht) een systematische vergelijking.

 
## Wat is een gedeelde vectorruimte voor tekst en beeld?

 In een unimodaal systeem genereert een tekst-encoder vectoren die uitsluitend semantische relaties tussen woorden of alinea's weerspiegelen. Twee synonieme zinnen liggen dicht bij elkaar, maar een afbeelding van hetzelfde concept heeft geen equivalente positie in die ruimte. Raadpleeg het artikel waarin [embeddingmodellen vergeleken](https://hub.llmnet.nl/embeddingmodellen-vergeleken) worden om te zien hoe zuiver tekstuele embeddingmodellen semantiek abstraheren.

 Een multimodale vectorruimte heft deze barrière op door twee verschillende encoders — één voor visuele invoer en één voor tekst — te trainen op één gemeenschappelijke doelfunctie. Het resultaat is een $d$-dimensionale ruimte (vaak 512, 768 of 1024 dimensies) waarin zowel een foto van een rode sportwagen als de tekststring "een snelle rode Italiaanse auto op het circuit" worden omgezet in een genormaliseerde vector. De mate van inhoudelijke overeenkomst tussen de twee modaliteiten wordt vervolgens direct uitgedrukt via de cosinusovereenkomst (cosine similarity):

 similarity = cos(theta) = (v_tekst . v_beeld) / (||v_tekst|| * ||v_beeld||)

 Omdat beide vectoren tijdens de transformatie worden genormaliseerd naar een eenheidslengte (lengte 1,0), reduceert de berekening tot een eenvoudig inproduct (dot product). Een hoge cosinuswaarde (dicht bij 1,0) betekent dat de tekstuele beschrijving en de visuele elementen van de afbeelding dezelfde semantische betekenis delen, ongeacht de oorspronkelijke vorm van de data.

 
## De architectuur van CLIP: dual encoders en contrastief leren

 De kracht van CLIP schuilt in de eenvoud van zijn architectonische opzet: het dual encoder-framework. Het model bestaat uit twee parallelle componenten die onafhankelijk van elkaar opereren tijdens inferentie:

 
 
- De Vision Encoder: Meestal geïmplementeerd als een Vision Transformer (ViT), zoals ViT-B/32 of ViT-L/14, of als een gemodificeerd ResNet-netwerk (zoals ResNet-50). De Vision Transformer verdeelt een afbeelding in vaste patches (bijvoorbeeld 14x14 of 32x32 pixels), lineair projecteert deze naar patch-embeddings en verwerkt de ruimtelijke relaties via self-attention layers.
 
- De Text Encoder: Een standaard Transformer-decoder of -encoder die een getokeniseerde tekstreeks verwerkt en via een pooling-laag samenvat tot één representatieve vector van identieke dimensionaliteit als de visuele vector.
 

 Tijdens de trainingsfase worden batches van $N$ paren (afbeelding, bijbehorende tekst) tegelijkertijd ingeladen. Voor een batchgrootte van $N$ genereert het model $N$ beeldvectoren en $N$ tekstvectoren. Hierdoor ontstaat een $N \times N$ matrix van cosinusovereenkomsten. Het contrastieve leerdoel (de InfoNCE-loss) dwingt het model om twee specifieke doelen simultaan te optimaliseren:

 
 
- Maximaliseer de cosinusovereenkomst op de hoofddiagonaal van de matrix ($N$ correcte paren van afbeelding en tekst).
 
- Minimaliseer de cosinusovereenkomst voor alle $N^2 - N$ incorrecte combinaties binnen dezelfde batch (negatieve voorbeelden).
 

 # Vereenvoudigde representatie van de CLIP contrastieve matrix
import torch
import torch.nn.functional as F

# I_e: beeldvectoren (N x D), T_e: tekstvectoren (N x D)
I_e = F.normalize(image_encoder(images), dim=-1)
T_e = F.normalize(text_encoder(texts), dim=-1)

# Bereken logits met temperatuurschaal tau
logits = torch.matmul(I_e, T_e.T) * torch.exp(temperature)
labels = torch.arange(N)

# Symmetrische cross-entropy loss over rijen en kolommen
loss_i = F.cross_entropy(logits, labels)
loss_t = F.cross_entropy(logits.T, labels)
loss = (loss_i + loss_t) / 2.0

 Doordat het model uitsluitend leert door paren met elkaar te contrasteren op enorme schaal (oorspronkelijk 400 miljoen beeld-tekstparen), bouwt het een robuust begrip op van objecten, stijlen, context en acties zonder dat er ooit specifieke categorielabels aan te pas zijn gekomen.

 
## Zero-shot classificatie: herkennen zonder gelabelde trainingsdata

 Klassieke computervisie vereist voor elke nieuwe taak een gelabelde dataset: wie hondenrassen wil herkennen, traint een lineaire laag op duizenden foto's van labradors, poedels en terriërs. CLIP maakt dit proces overbodig via zero-shot classificatie.

 Bij zero-shot classificatie worden de gewenste klassenamen ingebed in een prompttemplate, zoals "Een foto van een {klasse}" of "Een close-up van een {klasse}". De tekst-encoder berekent vooraf de embeddings voor alle mogelijke klassen. Wanneer er een nieuwe afbeelding binnenkomt, genereert de vision-encoder de bijbehorende beeldvector. Vervolgens wordt de cosinusovereenkomst berekend tussen de beeldvector en alle vooraf berekende tekstvectoren. De klasse met de hoogste score wordt geselecteerd als voorspelling via een softmax-functie:

 
 
 
 
 Eigenschap | 
 Klassieke ResNet/ViT Classifier | 
 CLIP Zero-Shot Benadering | 
 

 
 
 
 Trainingsvereiste per taak | 
 Noodzakelijk (nieuwe classificatiekop + finetuning) | 
 Geen (volledig zero-shot via tekstprompts) | 
 

 
 Flexibiliteit in klassen | 
 Vast aantal uitgangen (bijv. 1000 bij ImageNet) | 
 Dynamisch uitbreidbaar op runtime | 
 

 
 Gevoeligheid voor distributieverschuiving | 
 Hoog (faalt snel bij schetsen, tekeningen of ruis) | 
 Laag (sterk generaliserend vermogen over stijlen heen) | 
 

 
 Afhankelijkheid van promptontwerp | 
 Niet van toepassing | 
 Aanzienlijk (prompt ensembling noodzakelijk voor topresultaten) | 
 

 
 
 

 In de praktijk verbetert prompt ensembling — het middelen van embeddings over meerdere promptvarianten zoals "een foto van een kleine [X]", "een korrelige foto van de [X]" en "een gecentreerde afbeelding van een [X]" — de classificatienauwkeurigheid vaak met meerdere procentpunten zonder extra inferentiekosten voor de beeldzijde.

 
## Cross-modale retrieval en visual search in de praktijk

 De belangrijkste industriële toepassing van multimodale embeddings is cross-modale retrieval: het doorzoeken van grote beeldcollecties met natuurlijke spreektaal (tekst-naar-beeld), of het vinden van relevante documenten en producten op basis van een foto (beeld-naar-beeld of beeld-naar-tekst).

 In een productieomgeving worden alle afbeeldingen eenmalig door de vision-encoder gehaald. De resulterende vectoren worden opgeslagen in een gespecialiseerde vectordatabase (zoals Qdrant, Milvus of pgvector met HNSW-indexering). Wanneer een gebruiker een zoekopdracht typt, zet de tekst-encoder deze zoekterm om in een vector, waarna de database een Approximate Nearest Neighbor (ANN) zoekopdracht uitvoert. Om zo'n zoeksysteem technisch op te zetten, legt de handleiding over [semantisch zoeken bouwen via een API](https://api.llmnet.nl/semantisch-zoeken) stap voor stap uit hoe vectoren efficiënt vergeleken worden.

 Omdat vectoren in productieomgevingen continu veranderen door toevoegingen, mutaties en herberekeningen, is gedegen indexbeheer cruciaal. Lees hoe je [een vector-index moet onderhouden](https://api.llmnet.nl/vector-index-onderhoud) om prestatieverlies en geheugenfragmentatie bij miljoenen vectoren te voorkomen.

 
## Evolutie van CLIP: OpenCLIP, SigLIP en ColPali

 Sinds de publicatie van het originele CLIP-model zijn er substantiële methodologische verbeteringen doorgevoerd die de nauwkeurigheid en rekenefficiëntie flink hebben verhoogd:

 
 
- OpenCLIP: Een open-source reproductie en uitbreiding getraind op publieke datasets zoals LAION-5B. OpenCLIP leverde grotere modelvarianten op (zoals ViT-H/14 en ViT-bigG/14) die aanzienlijk beter presteren op fijnmazige visuele herkenningstaken.
 
- SigLIP (Sigmoid Loss for Language Image Pre-training): Ontwikkeld door Google Research. SigLIP vervangt de klassieke softmax-normalisatie over de gehele batch door een eenvoudige paarsgewijze sigmoid loss. Hierdoor kan elk beeld-tekstpaar als een onafhankelijk binair classificatieprobleem worden behandeld. Dit maakt efficiëntere training bij zeer grote batchgroottes mogelijk en levert consistent hogere zero-shot scores op.
 
- ColPali en Late Interaction: Waar standaard CLIP een complete afbeelding comprimeert tot één globale vector, gebruikt ColPali (gebaseerd op PaliGemma) een multi-vector representatie. Elk document of visuele pagina behoudt zijn individuele patch-tokens. Via ColBERT-achtige late interaction kunnen complexe documentlay-outs, tabellen en diagrammen accuraat doorzocht worden zonder traditionele OCR.
 

 Wie dieper wil ingaan op hoe moderne modellen visuele content interpreteren buiten embeddingruimtes om, vindt praktische handvatten in het artikel over [vision-modellen die beeld begrijpen](https://hub.llmnet.nl/vision-modellen-beeld-begrijpen-in-plaats-van-genereren). Voor toepassingen gericht op documentverwerking en tekstherkenning belicht de vergelijking tussen [vision-modellen en traditionele OCR](https://hub.llmnet.nl/vision-modellen-vs-traditionele-ocr) wanneer dense visual embeddings traditionele tekstextractie overbodig maken.

 
## Audio, video en bredere modaliteiten: voorbij stilstaand beeld

 Het contrastieve leermodel van CLIP beperkt zich wiskundig niet tot tekst en statische afbeeldingen. Dezelfde dual-encoder-principes worden inmiddels breed toegepast op andere zintuiglijke modaliteiten:

 
 
- CLAP (Contrastive Language-Audio Pre-training): Verbindt audiosignalen met tekstuele omschrijvingen. Audiosignalen worden omgezet in log-mel spectrogrammen en verwerkt door een 2D convolutioneel netwerk of audio-transformer. Zo wordt het mogelijk om te zoeken naar concepten zoals "blaffende hond in de verte met regen" direct in ongeannoteerde audiobestanden. Bekijk het overzicht van [AI voor muziek en audio](https://hub.llmnet.nl/audio-en-muziek-modellen) om te zien hoe gespecialiseerde audiomodellen zich verhouden tot brede multimodale systemen.
 
- Video-CLIP: Breidt de vision encoder uit met een temporele dimensie (3D-convoluties of spatio-temporele attention) om acties, camerabewegingen en dynamische sequenties direct te koppelen aan tekstprompts.
 
- ImageBind: Een door Meta ontwikkeld model dat zes verschillende modaliteiten (beeld/video, tekst, audio, dieptekaarten, thermische data en bewegingssensoren/IMU) in één enkele vectorruimte combineert door alle modaliteiten te koppelen aan een centrale visuele ankerruimte.
 

 Om te begrijpen hoe ruwe signalen uit verschillende zintuiglijke bronnen worden opgesplitst in hanteerbare inputs voor transformernetwerken, biedt de gids over [multimodale tokenisatie van beelden en audio](https://leren.llmnet.nl/multimodale-tokenisatie-uitgelegd) een grondige wiskundige basis.

 
## Fundamentele beperkingen en blinde vlekken van CLIP

 Hoewel CLIP uitblinkt in algemene semantische categorisatie, kent de architectuur duidelijke tekortkomingen waar ingenieurs rekening mee moeten houden:

 1. Het "Bag-of-Words"-fenomeen en gebrek aan compositioneel begrip
 Omdat CLIP getraind is op globale beeld-tekstovereenkomsten, faalt het model regelmatig bij taken die een strikte grammaticale relatie of ruimtelijke volgorde vereisen. Het model heeft grote moeite om het verschil te herkennen tussen "een rode kubus op een blauwe cirkel" en "een blauwe kubus op een rode cirkel". Beide zinnen genereren nagenoeg identieke cosinusscores voor beide afbeeldingen.

 2. Exact tellen en numeriek inzicht
 CLIP kan concepten zoals "weinig", "veel" of "een groep mensen" onderscheiden, maar faalt betrouwbaar wanneer gevraagd wordt om exact zeven appels op een tafel te identificeren tegenover acht appels.

 3. Resolutieverlies en kleine visuele details
 Omdat beelden tijdens de preprocessing worden geschaald naar vaste resoluties (zoals 224x224 of 336x336 pixels) en vervolgens worden opgedeeld in patches (zoals 14x14 pixels), verdwijnen fijne texturen, kleine tekstelementen en verre objecten volledig uit de finale embedding.

 Voor wie modelprestaties op deze specifieke blinde vlekken wil valideren, biedt het benchmarkdossier over [multimodale AI evalueren](https://benchmark.llmnet.nl/multimodale-evaluatie) gestandaardiseerde methodologieën om betrouwbaarheid en hallucinaties bij beeldverwerking te kwantificeren.

 
## Privacy, AVG en compliance bij multimodale dataverwerking

 Het verwerken van beeld- en audiomateriaal met multimodale embeddingmodellen brengt specifieke juridische verplichtingen met zich mee onder de Algemene Verordening Gegevensbescherming (AVG). Afbeeldingen van personen bevatten per definitie persoonsgegevens, en in specifieke contexten kunnen embeddings van gezichten worden aangemerkt als biometrische gegevens met het oog op unieke identificatie (bijzondere categorie persoonsgegevens onder Artikel 9 AVG).

 Wanneer embeddings worden gegenereerd op basis van camerabeelden, medische scans of werknemersfoto's, moeten organisaties een geldige verwerkingsgrondslag hanteren en dataminimalisatie toepassen. Voor een gedetailleerde juridische toetsing behandelt het dossier over [AI-modellen en privacy inzake AVG-compliance](https://hub.llmnet.nl/ai-modellen-en-privacy-avg-compliance) hoe verwerkersovereenkomsten, retentieperiodes en lokale hostingstrategieën moeten worden ingericht.

 Bij het bouwen van een robuuste API-architectuur voor multimodale inferentie kan het integreren van gateways en modelrouters helpen om verzoeken dynamisch te routeren en uitval op te vangen. Lees de uitleg over [API-aggregators en model-gateways](https://api.llmnet.nl/aggregator-uitleg) om te zien hoe proxy-architecturen rate limits en provider-redundantie beheren.

 
## Vergelijkende matrix van toonaangevende embeddingmodellen

 De onderstaande tabel vergelijkt de belangrijkste multimodale embeddingmodellen die op dit moment in productieomgevingen worden ingezet op basis van architectuur, resolutie en toepassingsgebied:

 
 
 
 
 Model | 
 Modaliteiten | 
 Resolutie | 
 Dimensies | 
 Primaire Toepassing | 
 

 
 
 
 OpenCLIP (ViT-B/32) | 
 Beeld / Tekst | 
 224 × 224 | 
 512 | 
 Lichtgewicht visual search en mobiele inferentie | 
 

 
 OpenCLIP (ViT-H/14) | 
 Beeld / Tekst | 
 224 × 224 | 
 1024 | 
 Hoge precisie zero-shot classificatie en e-commerce | 
 

 
 SigLIP (SO400M) | 
 Beeld / Tekst | 
 384 × 384 | 
 1152 | 
 Geavanceerde beeld-tekst retrieval met hoge resolutie | 
 

 
 ColPali (PaliGemma-3B) | 
 Documentbeeld / Tekst | 
 448 × 448 | 
 Multi-vector (128d/patch) | 
 Complexe PDF-, tabel- en rapportzoeksystemen (Visual RAG) | 
 

 
 CLAP (HTSAT-RoBERTa) | 
 Audio / Tekst | 
 Audio (48kHz) | 
 512 | 
 Audio-zoekmachines en geluidseffectencatalogi | 
 

 
 ImageBind (Huge) | 
 6 Modaliteiten | 
 Variabel per bron | 
 1024 | 
 Multisensorische onderzoeks- en sensor-fusie-applicaties | 
 

 
 
 

 
## Conclusie: de rol van multimodale vectoren in moderne AI-architecturen

 Multimodale embeddings vormen het bindweefsel tussen ongestructureerde visuele en auditieve media en gestructureerde computationele systemen. Waar generatieve vision-language modellen (zoals GPT-4o, Claude 3.5 Sonnet of Gemini Pro) uitblinken in diepgaande interactieve analyse en redeneren over afzonderlijke beelden, zijn dual-encoder modellen zoals CLIP en SigLIP onmisbaar voor grootschalige indexering, clustering en real-time retrieval over miljoenen bestanden.

 De keuze voor een specifieke multimodale embeddingarchitectuur hangt af van de afweging tussen latentie, geheugengebruik en detailniveau. Voor eenvoudige e-commerce zoekfuncties volstaat een compact SigLIP- of OpenCLIP-model met een vaste vector per afbeelding. Voor veeleisende documentverwerking en technische handleidingen bieden multi-vector late-interaction benaderingen zoals ColPali de hoogste trefzekerheid door visuele pagina-elementen intact te laten in de zoekindex.
