# Wie funktioniert KI-Transkription: 6 Schritte erklärt

URL: https://heartheweb.com/de/journal/wie-funktioniert-ki-transkription
Type: blog
Locale: de
Published: 2026-08-06
Updated: 2026-08-15

---

> KI-Transkription kettet ein akustisches Modell und ein Sprachmodell. 95-99% Genauigkeit auf sauberem Audio, $0,05-$0,25 pro Minute - und klare Grenzen bei Lärm und vielen Sprechern.

Wie funktioniert KI-Transkription? Das System kettet zwei spezialisierte Modelle: ein akustisches Modell liest die Schallwelle als Frequenzkarte und extrahiert Phonemsequenzen, ein Sprachmodell fügt diese Sequenzen zu kohärenten Wörtern, Sätzen und Zeichensetzung zusammen. Auf sauberem Audiomaterial - ein Sprecher, ruhige Umgebung - erreichen moderne Systeme 95-99% Genauigkeit und liefern ein Transkript innerhalb weniger Minuten. Bei Aufnahmen aus der realen Welt - Meetings mit Überlappungen, Calls mit Hintergrundgeräuschen - sinkt die Genauigkeit auf 85-92%. Das ist immer noch schnell und günstig genug, dass hybride Workflows für die meisten Wissensarbeiter sinnvoller sind als vollständige menschliche Transkription.

## Die sechs Schritte vom Ton zum Text

Die Pipeline ist über alle Dienste hinweg konsistent, auch wenn sich die zugrunde liegenden Modelle unterscheiden:

- 
**Audio-Aufnahme** - die Datei wird verarbeitet (hochgeladen oder live gestreamt) und in ein Format normalisiert, das das akustische Modell verarbeiten kann.

- 
**Spektrogramm-Extraktion** - die rohe Schallwelle wird in ein Spektrogramm umgewandelt: eine Frequenz-Zeit-Darstellung, die zeigt, welche Schallfrequenzen zu welchem Zeitpunkt aktiv sind.

- 
**Phonem-Zuordnung** - das akustische Modell identifiziert Phoneme, die kleinsten Klangeinheiten, aus dem Spektrogramm. Ein Wort wie "dreißig" wird zunächst in eine Phonemfolge aufgelöst, bevor es zu Text wird.

- 
**Sprachmodellierung** - ein Sprachmodell nimmt die Phonemsequenz und löst sie in Wörter auf, mit Kontext zur Auflösung von Mehrdeutigkeiten. "Der neue Bericht" versus "der nun bericht" wird hier entschieden, nicht im akustischen Schritt.

- 
**Speaker-Diarisierung** - wenn die Aufnahme mehrere Stimmen enthält, segmentiert ein separates Modell das Transkript nach Sprecher-Clustern. Jedes Segment erhält ein Label: Sprecher A, Sprecher B.

- 
**Nachbearbeitung** - Zeichensetzung, Großschreibung und domänenspezifische Korrekturen werden angewendet. Das Transkript wird geliefert, typischerweise mit Zeitstempeln auf Wort- oder Satzebene.

Schritte 1-3 dauern Millisekunden pro Audiominute. In den Schritten 4-6 divergiert die Qualität zwischen den Diensten erheblich.

![Audio-Wellenform in Text umgewandelt - KI-Spracherkennung Visualisierung](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/e9b2b1-img-1.webp)

## Das akustische Modell: Sprache als Spektrogramm lesen

Das akustische Modell "hört" die Aufnahme nicht so wie ein Mensch. Es liest ein Spektrogramm - eine Heatmap, bei der die horizontale Achse die Zeit ist, die vertikale Achse die Frequenz, und die Farbintensität die Amplitude darstellt. Das Modell hat Klang nie als Empfindung erlebt. Es verarbeitet Daten.

OpenAIs Whisper, 2022 veröffentlicht und heute der Benchmark, an dem die meisten kommerziellen Dienste gemessen werden, verwendet eine Encoder-Decoder-Transformer-Architektur. Der Encoder verarbeitet das Spektrogramm durch Self-Attention-Schichten, die Beziehungen über den gesamten Audioclip erfassen. Anders als ältere rekurrente Netzwerke, die Audio Wort für Wort verarbeiteten, liest der Transformer die gesamte Aufnahme auf einmal, bevor er Text generiert. Der Decoder produziert dann Token für Token Text und berücksichtigt sowohl das kodierte Audio als auch alles, was bereits geschrieben wurde.

Whisper Large-v3 erreicht 2,7% Word Error Rate (WER) auf LibriSpeech-Testdaten: Hörbuchaufnahmen mit einem einzelnen Sprecher, ohne Hintergrundgeräusche, klare Aussprache. Bei echten Meeting-Aufnahmen mit mehreren Sprechern und Umgebungsgeräuschen steigt die WER auf 8-12%. Diese Lücke zwischen Benchmark-Bedingungen und realen Bedingungen ist die nützlichste Zahl beim Lesen von Anbieter-Genauigkeitsangaben.

Whisper wurde auf 680.000 Stunden Web-Audio in 96 Sprachen trainiert und generalisiert besser auf Akzente, Aufnahmegeräte und Sprechstile, die ältere Modelle nie gesehen hatten. Frühere Modelle wie Wav2Vec 2.0 benötigten deutlich mehr domänenspezifisches Fine-Tuning.

## Warum die Sprachmodellschicht die Genauigkeit seit 2022 verändert hat

Bevor Large Language Models weitgehend verfügbar wurden, trug das akustische Modell den größten Teil des Transkriptionsgewichts. Wenn eine Phonemsequenz mehrdeutig war, riet das System anhand von N-Gramm-Wahrscheinlichkeiten. Deshalb gab ältere Transkriptionssoftware regelmäßig das falsche Homophon aus oder verfehlte Eigennamen vollständig.

Der Wandel nach 2022: viele Dienste leiten die grobe Ausgabe des akustischen Modells durch ein LLM zur Nachbearbeitung. Das LLM liest das vollständige Entwurfstranskript im Kontext und korrigiert Fehler, die das akustische Modell als unsicher markiert hatte. Es setzt Kommas, wo die Audiopause eines angedeutet hat. Es löst Homonyme anhand der umgebenden Sätze auf. Bei einigen Enterprise-Diensten werden Domänenwörterbücher - medizinisch, rechtlich, finanziell - angewendet, um Fachvokabular zu korrigieren, das das allgemeine akustische Modell falsch transkribiert hat.

Eine wachsende Teilmenge von Diensten nutzt die LLM-Schicht nicht nur zur Fehlerkorrektur, sondern auch für nachgelagerte Synthese: Meeting-Zusammenfassungen, Extraktion von Aktionspunkten, Folge-Entwürfe. Das Transkript wird zu einem Input für einen größeren Workflow statt zu einem Endpunkt. Sinnvoll, wenn das Ziel automatisierte Meeting-Protokolle sind. Weniger sinnvoll, wenn das rohe Transkript für Archivierung oder direkte Zitate benötigt wird - LLM-Zusammenfassungsschichten können Nuancen an den Rändern langer Aufnahmen einebnen.

Die Transkriptionsgenauigkeit ist dadurch nahezu zur Ware geworden. Die meisten Top-Dienste liegen zwischen 90-97% Genauigkeit bei typischen Aufnahmen. Die echten Differenzierungsmerkmale sind jetzt Preisgestaltung, Workflow-Integrationen, Qualität der Sprecher-Beschriftung und wie die Ausgabe in bestehende Tools exportiert.

![Team-Meeting mit live KI-Transkript auf geöffnetem Laptop-Bildschirm](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/9c071d-img-2.webp)

## Speaker-Diarisierung: Stimmen trennen, ohne zu wissen, wer spricht

Diarisierung ist das schwächste Glied in jedem KI-Transkriptionssystem, das 2026 verfügbar ist. Das Modell identifiziert Stimm-Cluster anhand akustischer Merkmale - Tonhöhe, Klang, Rhythmus - und weist Labels zu (Sprecher A, Sprecher B) ohne Kenntnis der Identität. In einem Zwei-Personen-Interview, bei dem sich keiner der Sprecher unterbricht, funktioniert das recht gut. In einem Call mit acht Personen, überlappender Sprache und Sprechern mit ähnlichen Stimm-Profilen bricht es zusammen.

Die meisten Dienste werben mit "Sprechererkennung", wenn sie tatsächlich Sprecher-Clustering liefern. Echte Identifikation - die Zuordnung einer Stimme zu einem bekannten Namen - erfordert eine vorab registrierte Sprachprobe, die nur eine Handvoll Enterprise-Dienste unterstützen. Otter.ai und Fireflies.ai bieten beide Namensabgleich an, sobald eine Stimme aufgenommen und beschriftet wurde. Die Kaltstart-Identifikation bei einem neuen Meeting mit neuen Teilnehmern produziert immer noch generische Sprecher-Labels.

Praktisch: Bei einer Aufnahme mit zwei bis drei Sprechern sind 90-95% Diarisierungsgenauigkeit realistisch. Bei sechs oder mehr Sprechern sollten 10-15 Minuten manuelle Korrektur pro Aufnahmestunde eingeplant werden. Diese Einschränkung erscheint auf den meisten Marketing-Seiten nicht prominent.

## Die Genauigkeitsgrenze: Was Wortfehlerrate in der Praxis bedeutet

Die Wortfehlerrate (WER) misst, wie viele Wörter in der KI-Ausgabe von einem Ground-Truth-Transkript abweichen. Eine WER von 5% bei einem 60-minütigen Meeting-Transkript - etwa 9.000 Wörter - bedeutet ungefähr 450 falsche Wörter, die durch das Dokument verteilt sind.

Drei Faktoren verschieben die Genauigkeit stärker als die Tool-Wahl:

**Aufnahmequalität.** Ein USB-Kondensatormikrofon in einem ruhigen Raum übertrifft konsistent jeden Unterschied zwischen Deepgram Nova-3 (5,26% median WER bei Batch-Verarbeitung) und Whisper (8,06% WER) bei derselben lauten Konferenzraum-Aufnahme. Das Aufnahme-Setup verschiebt die Genauigkeit um 15-20 Prozentpunkte. Die Tool-Wahl verschiebt sie um 1-3.

**Sprecheranzahl.** Zwei Sprecher bei 94% Genauigkeit. Sechs Sprecher bei 87%. Diarisierungsfehler summieren sich. Bei Meetings mit mehr als vier Teilnehmern sollte ein manueller Durchgang der Sprecher-Labels eingeplant werden, bevor diese in einem Dokument zur Zitation verwendet werden.

**Domänenvokabular.** Eigennamen, Markennamen, technische Akronyme und Fachterminologie sind die Stellen, an denen die Genauigkeit am stärksten sinkt. "DSGVO-Compliance" wird eher falsch transkribiert als "Verschieben wir das Meeting auf Donnerstag". Dienste mit benutzerdefiniertem Vokabulartraining oder domänenspezifischer Modell-Feinabstimmung machen hier einen messbaren Unterschied.

Kostenkontext: KI-Transkription kostet $0,05-$0,25 pro Minute. Menschliche Transkription kostet $0,72-$1,50 pro Minute. Der 5-20-fache Kostenunterschied ist groß genug, dass ein gezielter menschlicher Korrektur-Durchgang bei $0,30-$0,50 pro Minute trotzdem günstiger ist als vollständige menschliche Transkription für die meisten Workflows.

Echtzeit-Transkription - Live-Untertitel während eines Calls - arbeitet unter einer anderen Bedingung als Batch-Verarbeitung. Das Modell kann nicht vorauslesen, weil das Audio noch nicht gesprochen wurde. Echtzeit-WER ist typischerweise 3-5 Prozentpunkte höher als Batch-WER für denselben Dienst. Wenn das Transkript nur nach dem Meeting benötigt wird, ist Batch-Verarbeitung fast immer die bessere Option.

![Kopfhörer und Notizbuch auf dem Schreibtisch neben Laptop mit Transkriptionsdokument](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/cd23ce-img-3.webp)

## KI-Transkription im Workflow von Wissensarbeitern

Der größte Teil der Berichterstattung über KI-Transkription konzentriert sich auf Meetings. Die interessantere Anwendung für Wissensarbeiter ist der vollständige Loop: Audio rein, Text raus, Text zurück in einen Lese- und Recherche-Workflow.

Der praktische Stack, Mitte 2026: das Meeting oder Interview in einem beliebigen Tool aufnehmen. Das Audio exportieren oder den Dienst es nativ verarbeiten lassen. Das Transkript kommt mit Zeitstempeln auf Wortebene, Sprecher-Labels und - bei Diensten wie tl;dv - einer generierten Zusammenfassung zurück. Das rohe Transkript in Obsidian, Notion oder Readwise für Suche und Hervorhebungen einziehen. Das Transkript, nicht die Aufnahme, wird zum durchsuchbaren, referenzierbaren Artefakt.

Für Menschen, die bereits Audio nutzen, um Informationen beim Pendeln aufzunehmen: Transkription schließt den Loop in die entgegengesetzte Richtung. Der aufgezeichnete Call kann unterwegs gehört werden, dann kann das Transkript später nach der Zeile durchsucht werden, die in ein Dokument zitiert werden muss. Kein Bildschirm für den Hördurchgang. Kein Audio für den Referenzdurchgang. Praktisch auch, wenn der Bildschirm gerade nicht verfügbar ist.

QUEUE: durchsuchbar ohne Neuabspielen der Aufnahme. Das ist der funktionale Fall für KI-Transkription im Wissensarbeiter-Workflow - jenseits des Meeting-Automatisierungs-Pitches, mit dem die meisten Tools werben.

## Vor Ihrer nächsten Aufnahme

Zwei Dinge, die es wert sind, vorher zu überprüfen.

Erstens: Wie wurde es aufgenommen? Ein anständiges Mikrofon und ein ruhiger Raum machen mehr Unterschied für die Transkriptionsgenauigkeit als die Wahl des Dienstes. Fünfzehn Minuten Audio-Setup kaufen etwa 15 Prozentpunkte Genauigkeit in der Ausgabe.

Zweitens: Müssen die Sprecher-Labels korrekt sein, oder nur die Wörter? Wenn nach Namen zitiert wird, sollte ein manueller Diarisierungsdurchgang eingeplant werden. Wenn nur ein durchsuchbares Protokoll eines Team-Calls benötigt wird, kann die KI laufen gelassen werden. Fehler bei Sprecher-Labels sind weniger wichtig, wenn nach einem Konzept gesucht wird, nicht nach der Attribution eines Zitats zu einer bestimmten Person.

KI-Transkription ist schnell, kostet einen Bruchteil menschlicher Alternativen und ist genau genug für die meisten Aufnahmetypen. Sie ist nicht neutral gegenüber Audiobedingungen, und sie ist nicht zuverlässig bei der Sprecher-Trennung für große Calls. Diese zwei Grenzen kennen, bevor ein Workflow darum herum aufgebaut wird.

## FAQ

### Wie genau ist KI-Transkription bei deutschen Akzenten und Dialekten?

Modelle wie Whisper Large-v3 wurden auf 680.000 Stunden Web-Audio in 96 Sprachen trainiert, was eine solide Basis für regionale Varianten bietet. Bei starken Dialekten steigt die WER jedoch deutlich. Domänenspezifisches Fine-Tuning oder benutzerdefiniertes Vokabular verbessern die Ergebnisse messbar.

### Was ist der Unterschied zwischen Echtzeit- und Batch-Transkription?

Bei der Echtzeit-Transkription kann das Modell nicht vorauslesen, da das Audio noch nicht gesprochen wurde. Die WER ist typischerweise 3-5 Prozentpunkte höher als bei Batch-Verarbeitung. Batch-Verarbeitung liefert ein 60-minütiges Transkript in unter 5 Minuten und ist bei höherer Genauigkeit die bessere Wahl, wenn das Transkript nicht live benötigt wird.

### Kann KI mehrere Sprecher automatisch beim Namen nennen?

Die meisten Dienste bieten Speaker-Clustering, keine echte Identifikation. Labels wie Sprecher A und Sprecher B werden anhand akustischer Merkmale zugewiesen. Echte Identifikation - Name plus Stimme - erfordert vorregistrierte Sprachproben. Otter.ai und Fireflies.ai unterstützen dies, sobald Stimmen einmal erfasst wurden.

### Was kostet KI-Transkription im Vergleich zu menschlicher Transkription?

KI-Transkription: $0,05-$0,25 pro Minute. Menschliche Transkription: $0,72-$1,50 pro Minute. Der Kostenunterschied beträgt das 5-20-Fache. Ein gezielter Korrektur-Durchgang nach der KI-Transkription bei $0,30-$0,50 pro Minute ist für die meisten Anwendungsfälle immer noch günstiger als vollständig menschliche Transkription.

### Welcher Faktor beeinflusst die Transkriptionsgenauigkeit am stärksten?

Die Aufnahmequalität. Ein gutes USB-Mikrofon in einem ruhigen Raum verschiebt die Genauigkeit um 15-20 Prozentpunkte - mehr als jeder Unterschied zwischen den führenden Diensten (1-3 Prozentpunkte). Die Tool-Wahl ist sekundär. Setup zuerst, dann Tool-Wahl.

### Wie viele Sprecher verarbeitet KI-Diarisierung zuverlässig?

Bei zwei bis drei Sprechern sind 90-95% Diarisierungsgenauigkeit realistisch. Bei sechs oder mehr Sprechern sollten 10-15 Minuten manuelle Korrektur pro Aufnahmestunde eingeplant werden. Überlappende Sprache und ähnliche Stimm-Profile erhöhen die Fehlerrate weiter.

### Welche Tools nutzen KI-Transkription über reine Wortprotokoll-Ausgabe hinaus?

Dienste wie Fireflies.ai, Otter.ai, tl;dv und Descript integrieren Transkription in breitere Workflows: Meeting-Zusammenfassungen, Aktionspunkt-Extraktion, Podcast-Schnitt. Das Transkript wird dabei zum Input für weitere Verarbeitung, nicht nur zum Protokoll.