# Hoe werkt AI-transcriptie: zes stappen van geluid naar tekst

URL: https://heartheweb.com/nl/journal/hoe-werkt-ai-transcriptie
Type: blog
Locale: nl
Published: 2026-08-20
Updated: 2026-08-20

---

> AI-transcriptie zet gesproken audio via zes stappen om naar tekst. Leer wat WER betekent, waarom diarization faalt bij grote groepen en waarom uw microfoon meer telt dan uw toolkeuze.

Hoe werkt AI-transcriptie? Het zet gesproken audio om naar geschreven tekst via twee gespecialiseerde modellen. Een akoestisch model leest de geluidsgolf als frequentiekaart en extraheert fonemenreeksen. Een taalmodel assembleert die reeksen tot coherente woorden, zinnen en leestekens. Op schone audio met een enkele spreker halen moderne systemen 95-99% nauwkeurigheid en leveren het transcript binnen minuten. Op werkelijke vergaderopnames met achtergrondgeluid daalt dat naar 85-92%. Hybride AI-plus-revisie workflows zijn voor de meeste kenniswerkers sneller en goedkoper dan volledige menselijke transcriptie.

## De zes stappen van geluid naar tekst

De verwerkingspijplijn is consistent bij alle diensten, ook al verschillen de onderliggende modellen:

- 
**Audio-inname** - het bestand wordt opgenomen (geüpload of live gestreamd) en genormaliseerd naar een formaat dat het akoestisch model kan verwerken.

- 
**Spectrogramextractie** - de ruwe geluidsgolf wordt omgezet in een spectrogram: een frequentie-over-tijdrepresentatie die toont welke geluidsfrequenties actief zijn op elk moment.

- 
**Foneem-mapping** - het akoestisch model identificeert fonemen, de kleinste geluidsenheden, uit het spectrogram. Het woord "dertig" wordt herleid tot iets als /D-EU-R-T-IH-X/ voor het tekst wordt.

- 
**Taalmodellering** - een taalmodel neemt de fonemenreeks en lost die op in woorden, waarbij context ambiguiteiten oplost. "Het nieuw rapport" versus "het gnu raport" wordt hier beslist, niet in de akoestische stap.

- 
**Speaker-diarization** - als de opname meerdere stemmen bevat, segmenteert een apart model het transcript per sprekercluster. Elk segment krijgt een label: Spreker A, Spreker B.

- 
**Nabewerking** - leestekens, hoofdletters en, bij veel diensten, domeinspecifieke correcties worden toegepast. Het transcript wordt geleverd, doorgaans met tijdstempels op woord- of zinsniveau.

Stap 1-3 duren milliseconden per minuut audio. Stap 4-6 zijn waar de kwaliteit uiteenloopt tussen diensten. De totale doorlooptijd voor een batch van 60 minuten audio bedraagt doorgaans minder dan vijf minuten.

![Audio-golfvorm omgezet naar tekstuitvoer - visualisatie van AI-spraakherkenning](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/e9b2b1-img-1.webp)

## Het akoestisch model: geluid lezen als spectrogram

Het akoestisch model "hoort" de opname niet zoals een mens dat doet. Het leest een spectrogram: een heatmap waarbij de horizontale as tijd is, de verticale as frequentie en de kleurintensiteit de amplitude weergeeft. Het model heeft geluid nooit als sensatie ervaren. Het verwerkt data.

Whisper van OpenAI, uitgebracht in 2022 en nu de benchmark waaraan de meeste commerciele diensten worden gemeten, gebruikt een encoder-decoder Transformer-architectuur. De encoder verwerkt het spectrogram via self-attention-lagen die relaties vastleggen over de gehele audioclip. In tegenstelling tot oudere recurrente netwerken processeerde de Transformer de volledige opname in een keer voor het tekst genereerde. De decoder produceert vervolgens tekst token voor token, waarbij zowel de gecodeerde audio als de reeds gegenereerde tekst worden meegenomen.

Whisper Large-v3 haalt 2,7% Word Error Rate (WER) op LibriSpeech testdata: audioboekopnames met een enkele spreker, geen achtergrondgeluid en heldere dictie. Op echte vergaderaudio met meerdere sprekers en omgevingsgeluid stijgt de WER naar 8-12%. Dat verschil tussen benchmarkcondities en werkelijke condities is het meest nuttige getal bij het lezen van vendor-nauwkeurigheidsclaims.

Eerdere modellen zoals Wav2Vec 2.0 en HuBert gebruikten een vergelijkbare zelfgesuperviseerde voorttrainingsstrategie, maar vereisten meer fine-tuning per taal en per audiodomain. Whisper's voordeel was schaal: getraind op 680.000 uur webaudio in 96 talen, generaliseerde het beter naar accenten, opnameapparatuur en spreekstijlen die oudere modellen nooit hadden verwerkt. Dat maakt het de feitelijke standaard voor de meeste commerciele diensten in 2026.

Een batch van 60 minuten audio verwerkt Whisper doorgaans in minder dan vijf minuten. De verwerkingssnelheid is voor de meeste kenniswerkers geen knelpunt. De nauwkeurigheid op domeinspecifieke termen is dat wel.

## Waarom de taalmodellaag na 2022 de nauwkeurigheid veranderde

Voor grote taalmodellen breed beschikbaar werden, droeg het akoestisch model het grootste deel van het transcriptiegewicht. Als een fonemenreeks ambigu was, raadde het systeem op basis van n-gram-kansen. Hierom produceerde oudere transcriptiesoftware regelmatig de verkeerde homofoon of miste eigennamen volledig.

De verschuiving na 2022: veel diensten sturen de ruwe uitvoer van het akoestisch model nu door een LLM voor nabewerking. De LLM leest het volledige concepttranscript in context en corrigeert fouten die het akoestisch model als onzeker had gemarkeerd. Het voegt komma's toe waar de audiopauze er een suggereerde. Het lost "hun/hen/ze" op met behulp van de omringende zinnen. Bij sommige enterprise-diensten worden domeinwoordenboeken toegepast voor medische, juridische of financiele terminologie.

Een groeiende subset van diensten gebruikt de LLM-laag niet alleen voor foutcorrectie, maar ook voor syntheseverwerking: vergaderssamenvattingen, extractie van actiepunten en concepten voor vervolgmails. Het transcript wordt een input voor een groter workflow in plaats van een eindpunt. Dat is nuttig als uw doel geautomatiseerde vergaderverslagen zijn. Minder nuttig als u het ruwe transcript wilt voor archivering of directe citaten, want LLM-samenvattingslagen vlakken nuance langs de randen van lange opnames overtuigend af.

Dit is ook waarom transcriptienauwkeurigheid bijna een commodity is geworden. De meeste topservices clusteren tussen 90-97% nauwkeurigheid op typische opnames. De echte onderscheidende factoren zijn nu prijsstelling, workflow-integraties, kwaliteit van sprekerslabeling en hoe de uitvoer exporteert naar uw bestaande tools.

![Teamvergadering met live AI-transcript zichtbaar op open laptopscherm](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/9c071d-img-2.webp)

## Speaker-diarization: stemmen scheiden zonder namen te kennen

Diarization is de zwakste schakel in elk AI-transcriptiesysteem dat in 2026 beschikbaar is. Het model identificeert stemmenclusters op basis van akoestische kenmerken: toonhoogte, toon en ritme. Het wijst labels toe (Spreker A, Spreker B) zonder enige kennis van identiteit. In een tweepersoonsinterview zonder onderbrekingen werkt dit redelijk goed. In een gesprek met acht personen, externe deelnemers op slechte verbindingen en sprekers met vergelijkbare stemprofielen, gaat het fout.

De meeste diensten adverteren met "sprekeridentificatie" terwijl ze spreker-clustering leveren. Echte identificatie, het koppelen van een stem aan een bekende naam, vereist een vooraf geregistreerd stemmonster. Dat ondersteunen slechts enkele enterprise-diensten. Otter.ai en Fireflies.ai bieden naamkoppeling zodra een stem is opgenomen en gelabeld, maar coldstart-identificatie in een nieuwe vergadering produceert nog altijd generieke Spreker-labels.

Praktisch gebruik: bij een opname met twee tot drie sprekers verwacht u 90-95% diarization-nauwkeurigheid. Bij zes of meer sprekers begroot u 10-15 minuten handmatige correctie per uur opname. Die beperking staat niet prominent op de meeste marketingpagina's.

Signal/ruis: de kwaliteit van diarization hangt sterker af van de opnameconfiguratie dan van de gekozen dienst. Externe deelnemers via een telefoonsignaal worden door elk systeem slechter herkend dan sprekers in dezelfde ruimte met een goede microfoon.

## De nauwkeurigheidsgrens: wat WER betekent in de praktijk

Word Error Rate meet hoeveel woorden in de AI-uitvoer afwijken van een referentietranscript. Een WER van 5% op een vergadering van 60 minuten, ruwweg 9.000 woorden, betekent ongeveer 450 onjuiste woorden verspreid door het document.

Drie factoren beinvloeden de nauwkeurigheid meer dan de toolkeuze:

**Opnamekwaliteit.** Een USB-condensormicrofoon in een stille kamer levert consistent betere resultaten. Het verschil is groter dan het gat tussen Deepgram Nova-3 (5,26% mediane WER bij batchverwerking) en Whisper (8,06% WER) op dezelfde lawaaierige vergaderopname. Opnameconfiguratie verschuift de nauwkeurigheid met 15-20 procentpunten. Toolkeuze verschuift die met slechts 1-3 procentpunten.

**Aantal sprekers.** Twee sprekers leveren 94% nauwkeurigheid. Zes sprekers leveren 87%. Diarization-fouten stapelen zich op. Voor vergaderingen met meer dan vier deelnemers plant u een handmatige controle van sprekerslabels voordat u die in een document gebruikt.

**Domeinvocabulaire.** Eigennamen, merknamen, technische acroniemen en gespecialiseerde terminologie zijn waar de nauwkeurigheid het hardst daalt. Een zin als "PCI DSS-compliance" wordt eerder verkeerd weergegeven dan "laten we de vergadering naar donderdag verplaatsen." Diensten met aangepaste vocabulairetraining of domeinspecifieke model-fine-tuning maken hier een meetbaar verschil.

Kostencontext: AI-transcriptie kost $0,05-$0,25 per minuut. Menselijke transcriptie kost $0,72-$1,50 per minuut, 5 tot 20 keer meer. Voor de meeste informatieve opnames, interviews, teamvergaderingen en lezingen, is AI-uitvoer op 90-96% nauwkeurigheid voldoende. Een gerichte menselijke correctiepass kost $0,30-$0,50 per minuut, wat nog altijd goedkoper is dan volledige menselijke transcriptie.

Realtime-transcriptie opereert onder een andere beperking dan batchverwerking. Het model kan niet vooruit kijken om ambiguiteiten op te lossen, want de audio is nog niet uitgesproken. Realtime-WER is doorgaans 3-5 procentpunten hoger dan batch-WER voor dezelfde dienst. Als u het transcript tijdens de vergadering nodig hebt, begroot u dat nauwkeurigheidsverschil. Als u het alleen achteraf nodig hebt, is batchverwerking vrijwel altijd de betere optie.

![Koptelefoon en notitieboek op bureau naast laptop met transcriptiedocument](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/cd23ce-img-3.webp)

## Waar AI-transcriptie past in een kenniswerker-audiostack

De meeste berichtgeving over AI-transcriptie richt zich op vergaderingen. De interessantere toepassing voor kenniswerkers is de volledige lus: audio in, tekst uit, tekst terug in een lees- en onderzoeksworkflow.

De praktische stack, midden 2026: neem de vergadering of het interview op in het tool dat de conversatie vastlegt. Exporteer de audio of laat de dienst dat native afhandelen. Het transcript komt terug met tijdstempels op woordniveau en sprekerslabels. Bij diensten als tl;dv of Granola voegt een gegenereerde samenvatting zich daarbij. Haal het ruwe transcript in Obsidian, Notion of Readwise voor zoeken en markeren. Het transcript, niet de opname, wordt het doorzoekbare en refereerbare artefact.

QUEUE: voor wie al audio gebruikt om informatie te absorberen tijdens het woon-werkverkeer, maakt transcriptie de lus in de omgekeerde richting compleet. U kunt een opgenomen gesprek beluisteren tijdens een wandeling. Later doorzoekt u het transcript naar de zin die u in een document wilt citeren. Geen scherm vereist voor het luistergedeelte. Geen audio vereist voor het referentiegedeelte. Nuttig ook als de omgeving een scherm niet toelaat.

Doorzoekbaar zonder de opname opnieuw te bekijken. Dat is de functionele reden voor AI-transcriptie in een kenniswerker-workflow, los van het vergaderautomatiseringspitch waarmee de meeste tools beginnen.

Voor wie interviews transcribeert: de tijdstempels op woordniveau maken het mogelijk direct naar een fragment terug te springen vanuit een aantekening. U noteert het tijdstip, zoekt het later op in het transcript en past het citaat aan. Sneller dan het audiobestand opnieuw doorzoeken.

## Voor uw volgende opname

Twee zaken die u wilt controleren voordat u iets transcribeert.

Eerste: hoe is het opgenomen? Een goede microfoon en een stille kamer maakt meer verschil voor de transcriptienauwkeurigheid dan welke dienst u ook kiest. Vijftien minuten audio-instelling levert ruwweg 15 procentpunten nauwkeurigheid op de uitvoer.

Tweede: moet uw workflow sprekerslabels correct hebben, of volstaan de woorden voor uw doel? Als u per naam citeert, plant u een handmatige diarization-controle. Als u een doorzoekbaar verslag van een teamgesprek nodig hebt, laat de AI lopen. Zoekt u achteraf naar een concept, dan doen fouten in sprekerslabels er minder toe. Zoekt u de exacte toewijzing van een citaat aan een specifieke persoon, plan dan een handmatige correctiepass.

AI-transcriptie is snel, kost een fractie van menselijke alternatieven en nauwkeurig genoeg voor de meeste opnametypes. Het is niet neutraal ten opzichte van audiocondities en niet betrouwbaar bij sprekerscheiding voor grote gesprekken. Ken die twee limieten voor u er een workflow omheen bouwt.

## FAQ

### Hoe nauwkeurig is AI-transcriptie in de praktijk?

Op schone audio met een enkele spreker halen moderne systemen 95-99% nauwkeurigheid. Op vergaderopnames met meerdere sprekers en achtergrondgeluid daalt dat naar 85-92%. Opnamekwaliteit bepaalt de nauwkeurigheid met 15-20 procentpunten; de keuze van de tool met slechts 1-3 procentpunten.

### Wat is het verschil tussen realtime en batch-transcriptie?

Bij batchverwerking laadt u de volledige opname op en ontvangt u het transcript achteraf. Bij realtime-transcriptie wordt de audio verwerkt terwijl u spreekt, voor live ondertiteling. Batchverwerking is doorgaans 3-5 procentpunten nauwkeuriger, omdat het model de volledige context van de opname kan gebruiken.

### Kan AI-transcriptie meerdere sprekers van elkaar onderscheiden?

Dat hangt af van het aantal sprekers en de opnamekwaliteit. Bij twee tot drie sprekers haalt diarization 90-95% nauwkeurigheid. Bij zes of meer sprekers daalt dat aanzienlijk. Plan bij grote groepen 10-15 minuten handmatige correctie per uur opname voor de sprekerslabels.

### Wat is Word Error Rate en hoe gebruik ik die als maatstaf?

Word Error Rate (WER) meet welk percentage woorden in het AI-transcript afwijkt van een referentietranscript. Een WER van 5% op een vergadering van 60 minuten betekent ruwweg 450 fout weergegeven woorden. U kunt uw eigen WER schatten door het AI-transcript te vergelijken met een handmatige steekproef van enkele minuten.

### Hoeveel kost AI-transcriptie vergeleken met menselijke transcriptie?

AI-transcriptie kost $0,05-$0,25 per minuut. Menselijke transcriptie kost $0,72-$1,50 per minuut, 5 tot 20 keer meer. Voor de meeste informatieve opnames is de AI-kwaliteit voldoende. Een gerichte menselijke correctiepass kost $0,30-$0,50 per minuut, wat nog altijd goedkoper is dan volledige menselijke transcriptie.

### Welke factor heeft de meeste invloed op de transcriptienauwkeurigheid?

Opnamekwaliteit, niet de toolkeuze. Een USB-condensormicrofoon in een stille kamer verschuift de nauwkeurigheid met 15-20 procentpunten. Het verschil tussen de beste en slechtste AI-dienst bedraagt slechts 1-3 procentpunten op dezelfde audio. Vijftien minuten audio-instelling leveren meer op dan een duurdere transcriptiedienst.

### Werkt AI-transcriptie ook voor het Nederlands?

Ja. Whisper, de basis voor de meeste commerciele diensten, is getraind op 680.000 uur webaudio in 96 talen waaronder het Nederlands. De nauwkeurigheid is vergelijkbaar met Engels, maar domeinspecifieke termen en dialecten verlagen de score. Controleer of uw dienst vocabulairetraining biedt voor Nederlandse vaktermen.