# Yapay Zeka Transkripsiyon Nasıl Çalışır: Ses ve Metin

URL: https://heartheweb.com/tr/journal/yapay-zeka-transkripsiyon-nasil-calisir
Type: blog
Locale: tr
Published: 2026-08-06
Updated: 2026-08-15

---

> Yapay zeka transkripsiyonu, sesi akustik model ve dil modeliyle metne çevirir. Her adımın nasıl işlediğini, WER pratikte ne anlama geldiğini ve diarizasyon sınırlarını bu rehberde bulacaksınız.

Yapay zeka transkripsiyon nasıl çalışır? Sistem, iki özelleşmiş modeli zincirleme bir araya getirir: akustik model sesi bir frekans haritası olarak okur ve fonem dizilerini çıkarır; dil modeli ise bu dizileri tutarlı sözcük, cümle ve noktalamaya dönüştürür. Temiz seste, yani sessiz bir odada tek konuşmacıyla yapılan kayıtlarda, modern sistemler %95-99 doğruluğa ulaşır ve transkripti dakikalar içinde teslim eder. Gerçek dünya kayıtlarında, toplantı gürültüsü ve arka plan sesinin olduğu ortamlarda bu oran %85-92'ye düşer. Bu yine de çoğu bilgi çalışanı için karma yapay zeka ile insan incelemesi iş akışlarını tam insani transkripsiyondan daha verimli kılar.

**TL;DR** Yapay zeka transkripsiyonu sesi iki aşamada işler: akustik model fonem dizileri üretir, dil modeli bunları tutarlı sözcüklere ve cümlelere çevirir. 2022 sonrasında büyük dil modelleri taslak transkriptler üzerindeki hata düzeltmeyi devraldı. Temiz kayıtlarda doğruluk %95-99, gerçek toplantılarda %85-92 civarında seyreder. Konuşmacı diarizasyonu hâlâ en zayıf halka olmaya devam eder. Kayıt kalitesi araç seçiminden 15-20 yüzde puanı daha büyük fark yaratır.

## Sesten metne giden altı adım

Pipeline, altta yatan modeller farklı olsa da tüm servisler arasında tutarlıdır:

- 
**Ses yakalama** -- Dosya işleme alınır (yükleme ya da canlı akış) ve akustik modelin işleyebileceği bir formata normalize edilir.

- 
**Spektrogram çıkarımı** -- Ham ses dalgası bir spektrograma dönüştürülür: yatay eksen zamanı, dikey eksen frekansı, renk yoğunluğu ise genliği temsil eden bir ısı haritasıdır.

- 
**Fonem eşleme** -- Akustik model, spektrogramdan fonemleri, yani sesin en küçük birimlerini tanımlar. "Otuz" gibi bir sözcük metne dönüşmeden önce /O-T-U-Z/ gibi bir diziye çözümlenir.

- 
**Dil modelleme** -- Bir dil modeli fonem dizisini alır ve bağlamı kullanarak belirsizlikleri gidererek sözcüklere dönüştürür. "Yeni rapor" mu yoksa "eni yapor" mu sorusu burada, akustik adımda değil, çözülür.

- 
**Konuşmacı diarizasyonu** -- Kayıtta birden fazla ses varsa, ayrı bir model transkripti konuşmacı kümelerine göre böler. Her segment bir etiket alır: Konuşmacı A, Konuşmacı B.

- 
**Son işleme** -- Noktalama, büyük harf kullanımı ve birçok serviste alan adı özelinde düzeltmeler uygulanır. Transkript, sözcük ya da cümle düzeyinde zaman damgalarıyla teslim edilir.

1-3. adımlar ses başına milisaniyeler alır. 4-6. adımlar servisler arasında kalite farkının oluştuğu noktadır.

![Ses dalgası metne dönüştürülürken yapay zeka konuşma tanıma görselleştirmesi](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/e9b2b1-img-1.webp)

## Akustik model: sesi spektrogram olarak okumak

Akustik model kaydı bir insanın duyduğu gibi "duymaz". Yatay ekseni zaman, dikey ekseni frekans ve renk yoğunluğunun genliği temsil ettiği bir ısı haritası olan spektrogramı okur. Model sesi hiçbir zaman duyum olarak deneyimlemez. Veriyi işler.

OpenAI'ın 2022'de yayınladığı ve artık çoğu ticari servisin karşı karşıya ölçüldüğü referans Whisper, kodlayıcı-çözücü Transformer mimarisini kullanır. Kodlayıcı, sesin tamamında ilişkileri yakalayan öz-dikkat katmanlarıyla spektrogramı işler. Sesi sözcük sözcük işleyen eski yinelemeli ağların aksine Transformer, metin üretmeden önce kaydın tamamını tek seferde okur. Çözücü ise hem kodlanmış sese hem de önceden yazılmış metne dikkat ederek sözcükleri teker teker üretir.

Whisper Large-v3, LibriSpeech test-clean verisinde, yani tek konuşmacı, arka plan gürültüsü yok, net telaffuz olan ses kitabı kayıtlarında, %2,7 Kelime Hata Oranı (WER) elde eder. Birden fazla konuşmacının ve ortam sesinin bulunduğu gerçek toplantı sesinde WER %8-12'ye çıkar. Kıyaslama koşulları ile gerçek koşullar arasındaki bu fark, satıcıların doğruluk iddialarını değerlendirirken akılda tutulması gereken en kullanışlı sayıdır.

Wav2Vec 2.0 ve HuBERT gibi önceki modeller benzer bir öz-denetimli ön eğitim yaklaşımı kullanırdı, ancak dil ve ses alanı başına daha fazla ince ayar gerektirirdi. Whisper'ın avantajı ölçekti: 96 dilde 680.000 saatlik web sesinde eğitilen bu model, eski modellerin hiç karşılaşmadığı aksanlara, kayıt ekipmanlarına ve konuşma biçimlerine daha iyi genelleme yapabildi.

## Dil modeli katmanı neden 2022 sonrasında doğruluğu dönüştürdü

Büyük dil modelleri yaygın biçimde erişilebilir olmadan önce, akustik model transkripsiyonun büyük bölümünü taşırdı. Bir fonem dizisi belirsizse sistem n-gram olasılıklarına dayanarak tahmin ederdi. Bu yüzden eski transkripsiyon yazılımları sürekli yanlış eş sesli sözcük çıkarır ya da özel adları tamamen atlardı.

2022 sonrası değişim: Birçok servis artık akustik modelin ham çıktısını son işleme için bir büyük dil modelinden geçiriyor. Bu model taslak transkriptin tamamını bağlam içinde okur ve akustik modelin belirsiz olarak işaretlediği hataları düzeltir. Ses duraklamasının virgül gerektirdiği yere virgül ekler. Belirsizlikleri çevreleyen cümleler kullanarak çözer. Bazı kurumsal servislerde tıbbi, hukuki, mali alan sözlükleri uygulanarak genel akustik modelin yanlış tanıdığı sözcükler düzeltilir.

Giderek büyüyen bir servis alt kümesi, büyük dil modeli katmanını yalnızca hata düzeltme için değil, toplantı özetleri, eylem maddesi çıkarımı ve takip taslakları gibi aşağı akış sentezi için de kullanıyor. Transkripsiyon, daha geniş bir iş akışının girdisi hâline gelir. Otomatik toplantı kayıtları hedefliyorsanız bu kullanışlıdır. Arşivleme ya da doğrudan alıntı için ham transkript istiyorsanız daha az kullanışlıdır: büyük dil modeli özetleme katmanları uzun kayıtların kenarlarındaki nüansları güvenle düzleyebilir.

Bu aynı zamanda transkripsiyon doğruluğunun neredeyse bir emtia hâline gelmesinin nedenidir. Başlıca servislerin büyük çoğunluğu tipik kayıtlarda %90-97 doğruluk aralığında kümeleniyor. Gerçek farklılaştırıcılar artık fiyatlandırma, iş akışı entegrasyonları, konuşmacı etiketleme kalitesi ve çıktının mevcut araçlarınıza nasıl aktarıldığıdır.

![Canlı yapay zeka transkripti açık dizüstü bilgisayar ekranında görünen ekip toplantısı](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/9c071d-img-2.webp)

## Konuşmacı diarizasyonu: sesi, kimler olduğunu bilmeden ayırmak

Diarizasyon, 2026'da mevcut olan her yapay zeka transkripsiyon sisteminin en zayıf halkasıdır. Model, ses kümelerini yükseklik, ton ve ritim gibi akustik özelliklere dayanarak tanımlar ve kimlik bilgisi olmaksızın etiketler (Konuşmacı A, Konuşmacı B) atar. Hiçbir konuşmacının söz kesmediği iki kişilik bir röportajda bu makul biçimde çalışır. Bağlantı kalitesi düşük uzak katılımcıların, benzer ses profillerine sahip konuşmacıların ve örtüşen konuşmaların bulunduğu sekiz kişilik bir çağrıda ise bozulur.

Çoğu servis "konuşmacı tanımlama" vaat eder, oysa aslında konuşmacı kümeleme sunar. Model, kimliği önceden kayıtlı bir ses örneğine eşleştirmeksizin akustik farklılıklar temelinde sesler arasında ayrım yapar. Gerçek tanımlama, ses örneklerinin önceden kaydedilmesini gerektiren bir özellik, yalnızca avuç dolusu kurumsal servis tarafından desteklenir. Otter.ai ve Fireflies.ai, önceden kaydedilmiş ve etiketlenmiş bir sesi olan tekrarlayan katılımcılar için ad eşleştirme sunar; ancak yeni bir grup ile sıfırdan tanımlama hâlâ genel Konuşmacı etiketleri üretir.

Pratik kullanım için: iki veya üç konuşmacılı bir kayıtta %90-95 diarizasyon doğruluğu bekleyin. Altı veya daha fazla konuşmacıda her kayıt saati için 10-15 dakika manuel düzeltme ayırın. Bu sınırlama çoğu pazarlama sayfasında belirgin biçimde yer almaz.

## WER pratikte ne anlama gelir?

Kelime Hata Oranı, yapay zeka çıktısındaki sözcüklerin gerçek referans transkriptinden kaç tanesinin farklı olduğunu ölçer. 60 dakikalık bir toplantı transkriptinde, yaklaşık 9.000 sözcük, %5 WER yaklaşık 450 yanlış sözcük anlamına gelir.

Doğruluğu araç seçiminden daha fazla değiştiren üç faktör:

**Kayıt kalitesi.** Sessiz bir odada USB kondenser mikrofon, aynı gürültülü konferans odası kaydında Deepgram Nova-3 (%5,26 medyan WER, toplu işleme) ile Whisper (%8,06 WER) arasındaki farkın üstüne çıkmayı tutarlı biçimde başarır. Kayıt kurulumu doğruluğu 15-20 yüzde puanı ölçüsünde değiştirir. Araç seçimi ise 1-3 puan.

**Konuşmacı sayısı.** İki konuşmacıda %94 doğruluk. Altı konuşmacıda %87. Diarizasyon hataları birikir. Dörtten fazla katılımcının olduğu toplantılarda, konuşmacı etiketlerini herhangi bir belgede kullanmadan önce manuel gözden geçirme planlayın.

**Alan sözlüğü.** Özel adlar, marka isimleri, teknik kısaltmalar ve uzmanlaşmış terminoloji doğruluğun en çok düştüğü noktadır. "Toplantıyı Perşembe'ye alalım" ifadesi, "PCI DSS uyumluluğu" ifadesinden önce doğru tanınır. Özel sözcük dağarcığı eğitimi ya da alana özgü model ince ayarı sunan servisler burada ölçülebilir bir fark yaratır.

Maliyet bağlamı: Yapay zeka transkripsiyonu dakikada $0,05-$0,25 maliyetlidir. İnsani transkripsiyon dakikada $0,72-$1,50. Bilgilendirici kayıtların büyük bölümü için %90-96 doğrulukta yapay zeka çıktısı yeterlidir. 5-20 kat maliyet farkı yeterince büyüktür ki odaklanmış bir insan düzeltme geçişi, dakikada $0,30-$0,50 ederek, çoğu iş akışı için tam insani transkripsiyonu geride bırakır.

Gerçek zamanlı transkripsiyon, yani çağrı sırasında canlı altyazı, toplu işlemeden farklı bir kısıt altında çalışır. Model belirsizlikleri çözmek için ileriye bakamaz çünkü ses henüz söylenmemiştir. Gerçek zamanlı WER, aynı servisin toplu WER'den tipik olarak 3-5 yüzde puan daha yüksektir. Toplantı sırasında transkripsiyona ihtiyaç duyuyorsanız bu doğruluk farkı için bütçe ayırın. Yalnızca sonra ihtiyaç duyuyorsanız toplu işleme neredeyse her zaman daha iyi seçenektir.

![Dizüstü bilgisayarda transkripsiyon belgesinin göründüğü masaüstünde kulaklık ve not defteri](https://fdzlnqpwsaniezitwiuw.supabase.co/storage/v1/object/public/cms-media/heartheweb/2026-08/cd23ce-img-3.webp)

## Yapay zeka transkripsiyonu bilgi çalışanı ses yığınında nereye oturur

Yapay zeka transkripsiyonuna ilişkin içeriklerin büyük bölümü toplantılara odaklanır. Bilgi çalışanları için daha ilginç uygulama, tam döngüdür: ses içeri, metin dışarı, metin okuma ve araştırma iş akışına geri döner.

Pratik yığın, 2026 ortasında: Görüşmeyi ya da röportajı, konuşmayı yakalayan herhangi bir araçta kaydedin. Sesi dışa aktarın ya da servisin yerelde halletmesine izin verin. Sözcük düzeyinde zaman damgaları, konuşmacı etiketleri ve tl;dv ya da Granola gibi servislerde üretilmiş özet içeren transkript geri döner. Ham transkripti arama ve vurgulama için Obsidian, Notion ya da Readwise'a çekin. Kayıt değil transkript, aranabilir ve referans alınabilir yapıtı oluşturur.

Gidip gelişte bilgiyi emmek için sesi zaten kullananlar için: transkripsiyon döngüyü ters yönde tamamlar. Yürürken kaydedilen bir çağrıyı dinleyebilir, ardından bir belgeye alıntılamanız gereken satırı aramak için transkripten yararlanabilirsiniz. Dinleme geçişi için ekran gerekmez. Referans geçişi için ses gerekmez. Ekrana bakamadığınızda ya da elleriniz meşgulken de kullanılabilir.

Kaydı yeniden izlemeden aranabilir. Bu, çoğu aracın öne çıkardığı toplantı otomasyonu yaklaşımından bağımsız olarak, bir bilgi çalışanı iş akışında yapay zeka transkripsiyonunun işlevsel gerekçesidir.

## Bir sonraki kaydınızdan önce

QUEUE: Herhangi bir şeyi transkribe etmeden önce kontrol etmeye değer iki şey.

Birincisi: Nasıl kaydedildi? İyi bir mikrofon ve sessiz bir oda, hangi servisi seçeceğinizden çıktı doğruluğu üzerinde daha fazla fark yaratır. On beş dakika ses kurulumu, çıktıda yaklaşık 15 yüzde puanlık doğruluk kazandırır.

İkincisi: İş akışınız konuşmacı etiketlerinin doğru olmasını mı gerektiriyor, yoksa yalnızca sözcükleri mi? İsme göre alıntı yapıyorsanız manuel diarizasyon geçişi planlayın. Bir ekip çağrısının aranabilir kaydına ihtiyaç duyuyorsanız yapay zekayı serbest bırakın. Bir kavram ararken konuşmacı etiketlerindeki hatalar, belirli bir kişiye alıntı atfederken olduğundan çok daha az önem taşır.

Yapay zeka transkripsiyonu hızlıdır, insani alternatiflerin çok küçük bir maliyetine gelir ve çoğu kayıt türü için yeterince doğrudur. Ses koşulları konusunda tarafsız değildir ve büyük çağrılarda konuşmacı ayrımı konusunda güvenilir değildir. Etrafında bir iş akışı kurmadan önce bu iki sınırı bilin.

## FAQ

### Yapay zeka transkripsiyonu ile geleneksel ses tanıma arasındaki fark nedir?

Geleneksel ses tanıma yalnızca akustik modeli kullanır ve fonem olasılıklarına dayanarak sözcükleri tahmin eder. Yapay zeka transkripsiyonu, taslak transkriptin tamamını bağlam içinde okuyan, çevre cümleler kullanarak belirsizlikleri çözen ve akustik modelin belirsiz olarak işaretlediği hataları düzelten bir dil modeli katmanı ekler. Bu sayede doğal konuşmada önemli ölçüde daha yüksek doğruluk elde edilir.

### Yapay zeka transkripsiyonu ne kadar doğrudur?

Tek konuşmacılı temiz seste modern sistemler %95-99 doğruluğa ulaşır. Birden fazla konuşmacıyla gerçek dünya toplantı kayıtlarında doğruluk %85-92'ye düşer. İnsani transkripsiyon %99'un üzerinde kalır. Röportajlar, toplantılar ve dersler gibi bilgilendirici kayıtların büyük bölümü için yapay zeka doğruluğu yeterlidir. Hataların önemli sonuçları olan hukuki veya tıbbi belgelendirmede insan incelemesi standart olmaya devam eder.

### Yapay zeka transkripsiyonu kimin konuştuğunu otomatik olarak tanımlayabilir mi?

Çoğu servis, konuşmacı tanımlaması değil konuşmacı kümeleme sunar. Model, sesler arasındaki akustik farklılıklara dayanarak genel etiketler atar (Konuşmacı A, Konuşmacı B). Gerçek tanımlama, önceden kaydedilmiş bir ses örneği gerektirir. Otter.ai ve Fireflies.ai, tekrarlayan katılımcılar için ad eşleştirme sunar; ancak yeni bir grupla sıfırdan tanımlama hâlâ genel etiketler üretir.

### En iyi yapay zeka transkripsiyon sonuçları için ne tür bir ses kurulumu gerekir?

Kayıt kalitesi doğruluğu 15-20 yüzde puanı ölçüsünde değiştirir. Sessiz bir odada USB kondenser mikrofon, herhangi bir büyük transkripsiyon servisinde tutarlı biçimde %97-99 doğruluğa ulaşır. Tek konuşmacılı, sessiz ortam kayıtları hangi araç işlerse işlesin tutarlı biçimde yüksek doğruluğa ulaşır.

### Yapay zeka ile bir saatlik toplantıyı transkribe etmek ne kadar sürer?

Toplu işleme, başlıca servislerde 60 dakikalık bir toplantı transkriptini 5 dakikanın altında teslim eder. Gerçek zamanlı transkripsiyon, toplantı sırasında canlı altyazı üretir; ancak toplu işlemeye göre 3-5 yüzde puan daha yüksek WER ile çalışır. Transkripsiyona yalnızca sonradan ihtiyaç duyuyorsanız toplu işleme neredeyse her zaman daha iyi seçenektir.

### Kelime hata oranı (WER) nedir ve neden önemlidir?

Kelime Hata Oranı, yapay zeka çıktısındaki sözcüklerin bir referans transkriptinden kaç tanesinin farklı olduğunu ölçer. 60 dakikalık bir toplantıda %5 WER, yaklaşık 9.000 sözcüklük belgede 450 yanlış sözcük anlamına gelir. WER, servisleri aynı ses türünde karşılaştırmak için kullanışlıdır; ancak kayıt kalitesi araç seçiminden çok daha fazla WER'yi etkilediğinden mutlak tahminler için daha az güvenilirdir.

### Yapay zeka transkripsiyonu Türkçe ses kayıtları için de çalışır mı?

Whisper 96 dili destekler ve Türkçe bu diller arasındadır. Tek konuşmacılı, sessiz ortamda kaydedilen Türkçe ses için WER tipik olarak %5-15 arasındadır. Bölgesel aksanlar, teknik terminoloji ve birden fazla konuşmacı doğruluğu düşürür. Bir servise ya da iş akışına bağlanmadan önce kendi ses örneğiniz üzerinde test yapmanız önerilir.