AI文字起こしの仕組み:音声からテキストへの6ステップ

要約

AI文字起こしは音響モデルと言語モデルを連携させた2段階処理で動く。クリーンな音声では95〜99%の精度を達成するが、複数話者の会議録音では85〜92%に下がる。精度の上限を決める3要因は録音品質、話者数、ドメイン語彙だ。リアルタイムはバッチより3〜5ポイント低い。コストは分あたり$0.05〜$0.25で、人力の5〜20分の1。

通勤中にヘッドフォンを着用し、スマートフォンのAI文字起こし画面を見るナレッジワーカー

AI文字起こしの仕組みは、2つの専門モデルの連携にある。音声波形を周波数マップとして読み取り、音素配列を抽出する音響モデルと、その配列を文脈のある単語・文・句読点に組み立てる言語モデルだ。静かな環境の単一話者によるクリーンな音声なら、現行システムは95〜99%の精度を達成し、数分以内にトランスクリプトを返す。複数話者の会議録音や背景ノイズのある電話では精度は85〜92%に下がる。それでも速度とコストを考えると、AIによる文字起こしに人手確認を組み合わせるハイブリッドワークフローは、ほとんどのナレッジワーカーにとって全文人力より合理的な選択肢だ。

音声からテキストへの6ステップ

サービスごとに使用モデルは異なるが、パイプラインの構造はほぼ共通している。

  1. 音声入力 -- ファイルをアップロードするかライブストリームで取り込み、音響モデルが処理できる形式に正規化する。

  2. スペクトログラム変換 -- 生の音声波形を、横軸が時間、縦軸が周波数の2次元マップに変換する。各瞬間にどの周波数がどの強度で鳴っているかを可視化したものだ。

  3. 音素マッピング -- 音響モデルがスペクトログラムから音素(最小単位の音)を識別する。「thirty」という単語は「/TH-ER-T-IY/」という配列に分解されてからテキストになる。

  4. 言語モデリング -- 言語モデルが音素配列を受け取り、文脈から単語に変換する。「there / their / they're」の曖昧さはここで解決される。音響ステップではない。

  5. 話者分離(ダイアリゼーション) -- 複数の声が混在する場合、別のモデルが話者クラスターごとにセグメントを分類し、ラベルを付ける(話者A、話者B)。

  6. 後処理 -- 句読点の付与、大文字化、ドメイン固有の語彙修正が適用される。単語・文レベルのタイムスタンプとともにトランスクリプトが返される。

ステップ1〜3はオーディオ1分あたり数ミリ秒で処理される。品質の差が出るのはステップ4〜6だ。

Audio waveform converted into text output - AI speech recognition visualization

音響モデル:スペクトログラムを読む

音響モデルは録音を人間のように「聴く」わけではない。横軸が時間、縦軸が周波数、色の濃さが振幅を表すスペクトログラム(ヒートマップ)を処理する。モデルは音の感覚を持たず、データを読んでいる。

OpenAIのWhisperは、エンコーダー・デコーダー型Transformerアーキテクチャを採用している。エンコーダーはスペクトログラム全体を一度に読み取り、Self-Attentionレイヤーで音声クリップ内の関係性を捉える。旧来のRNNが単語ごとに処理していたのと異なり、Transformerは録音全体を先に読んでからテキストを生成する。デコーダーはエンコードされた音声と生成済みテキストの両方を参照しながら、1トークンずつ出力する。

Whisper Large-v3は、LibriSpeechのテスト用クリーンデータ(単一話者の朗読音声、背景音なし)でWER 2.7%を達成する。複数話者の会議音声では8〜12%まで上昇する。このベンチマーク環境と実環境のギャップが、ベンダーの精度主張を読む際に最も参照すべき数字だ。

言語モデルが精度を変えた理由

大規模言語モデルが普及する前、音響モデルがトランスクリプションのほぼ全工程を担っていた。音素配列が曖昧な場合はn-gramの確率で推測していたため、同音異義語の誤りや固有名詞の脱落が頻発した。

2022年以降の変化:多くのサービスが音響モデルの粗い出力をLLMで後処理するようになった。LLMはドラフト全体を文脈ごと読み、不確かな箇所を修正する。音声ポーズに対応する位置にカンマを挿入し、前後の文脈から同音異義語を判定する。エンタープライズ向けサービスでは、医療・法律・金融のドメイン辞書を適用して汎用モデルが誤読しやすい語彙を補正するものもある。

LLMレイヤーを活用する一部のサービスは、エラー修正にとどまらず下流の処理にも応用している。会議サマリーの生成、アクションアイテムの抽出、フォローアップ文書の下書きなどだ。アーカイブや直接引用が目的なら、LLMのサマリーレイヤーが長い録音の端でニュアンスを削る可能性を頭に入れておく必要がある。

精度の観点では上位サービスの多くが典型的な録音で90〜97%に収まり、コモディティ化が進んでいる。実際の差別化要因は価格、ワークフロー統合、話者ラベルの品質、既存ツールへのエクスポート形式になっている。

Team meeting with live AI transcript visible on open laptop screen

話者分離:声を識別しながら名前は知らない

ダイアリゼーションは、2026年現在のあらゆるAI文字起こしシステムで最も弱いリンクだ。モデルはピッチ・音調・リズムなどの音響特徴に基づいて話者クラスターを識別し、ラベルを付ける(話者A、話者B)。誰であるかは知らない。2名のインタビューで割り込みがなければそれなりに機能するが、接続品質の悪いリモート参加者が混在する8名規模のオンライン会議では精度が落ちる。

多くのサービスが「話者識別」を謳っているが、実際に提供しているのは話者クラスタリングだ。真の識別(声を既知の名前と照合する)には事前登録済みのサンプル音声が必要で、対応しているエンタープライズサービスは限られている。Otter.aiとFireflies.aiはどちらも声を録音・ラベリングした後の名前照合に対応しているが、初対面の参加者のみの会議ではコールドスタートになり、汎用の話者ラベルしか生成されない。

実務上の目安:2〜3名の録音では話者分離精度90〜95%を期待できる。6名以上では1時間の録音につき10〜15分の手動修正を見込む。この制限はほとんどのサービスのマーケティングページには目立って記載されていない。

精度の上限:WERが実務で意味すること

単語誤り率(WER)は、AI出力が正解トランスクリプトと異なる単語の割合を示す。60分の会議(約9,000単語)でWER 5%なら、ドキュメント全体に約450個の誤りが散在することになる。

ツール選択よりも精度を左右する3つの要因がある。

録音品質。 静かな部屋でのUSBコンデンサーマイクは、同じノイズだらけの会議室の録音に対してDeepgram Nova-3(バッチ処理の中央値WER 5.26%)とWhisper(WER 8.06%)の差を上回る影響を持つ。録音環境のセットアップで精度は15〜20ポイント変わる。ツール選択の差は1〜3ポイントだ。

話者数。 2名で精度約94%。6名で約87%。ダイアリゼーションのエラーが積み重なる。参加者が4名以上の会議では、特定の発言を名前に帰属させる前に手動で話者ラベルを確認する計画を立てておく。

ドメイン語彙。 固有名詞、ブランド名、技術的な略語・専門用語は精度が最も落ちる箇所だ。カスタム語彙トレーニングやドメイン固有のモデルファインチューニングを提供するサービスは、ここで計測可能な差を生む。

コストの目安:AI文字起こしは分あたり$0.05〜$0.25。人力は$0.72〜$1.50。インタビュー、チームミーティング、講義といった情報収集目的の録音なら、精度90〜96%のAI出力で十分なケースがほとんどだ。5〜20倍のコスト差は大きく、分あたり$0.30〜$0.50の集中的な人手修正を加えても全文人力より安くなる。

リアルタイム文字起こし(通話中のライブキャプション)はバッチ処理とは異なる制約で動く。音声がまだ発話されていないため、モデルは先読みして曖昧さを解消できない。リアルタイムWERは同一サービスのバッチWERより通常3〜5ポイント高い。会議後にだけトランスクリプトが必要ならバッチ処理を選ぶ方が品質が高い。

Headphones and notebook on desk next to laptop showing transcription document

ナレッジワーカーの音声スタックにおける位置づけ

AI文字起こしの記事の多くは会議録に焦点を当てる。ナレッジワーカーにとってより興味深い用途はループの完結だ。音声が入力され、テキストが出力され、テキストが読書・調査ワークフローに戻っていく。

2026年中盤の実用スタック:会議やインタビューを使い慣れたツールで録音し、音声をエクスポートするかサービスに直接処理させる。単語レベルのタイムスタンプ、話者ラベル、そしてtl;dvのようなサービスなら生成サマリーとともにトランスクリプトが返ってくる。生のトランスクリプトをObsidian、NotionまたはReadwiseに取り込んで検索・ハイライトに活用する。録音ではなくトランスクリプトが、検索可能で参照可能なアーティファクトになる。

通勤中に音声で情報を吸収することがある人には、文字起こしが逆方向のループを完成させる。歩きながら録音済みの通話を聴き、後でドキュメントに引用したい一行をトランスクリプトから検索する。音声再生にスクリーンは不要。参照にオーディオは不要。スクリーンを使えない状況でも、録音を見返さずに検索できる。これが会議自動化のピッチとは別の、ナレッジワーカーワークフローにおけるAI文字起こしの機能的な意義だ。

次の録音を始める前に

QUEUE: 文字起こしを始める前に確認する価値がある2つのこと。

まず、どのように録音したか。適切なマイクと静かな環境は、どのサービスを選ぶかよりもトランスクリプトの精度に大きく影響する。音声セットアップに15分かければ、出力の精度を約15ポイント改善できる。

次に、ワークフローで話者ラベルが正確である必要があるかどうか。名前で引用するなら手動の確認パスを計画する。チームコールの検索可能な記録が欲しいならAIに任せて走らせる。概念を検索する目的なら、話者ラベルのエラーは問題にならない。

AI文字起こしは速く、人力の代替に比べてコストの一部で済み、ほとんどの録音タイプに対して十分な精度を持つ。音声環境に対しては中立でなく、大規模な通話の話者分離については信頼性が下がる。ワークフローを構築する前に、この2つの限界を把握しておく。

よくある質問

AI文字起こしの精度はWERで何%くらいですか?
クリーンな英語音声(静かな環境の単一話者)では95〜99%の精度(WER 2〜5%)を達成します。複数話者の会議録音では85〜92%(WER 8〜15%)が現実的な範囲です。ツール選択より録音品質の方が精度に与える影響が大きく(15〜20ポイント差)、ツール差は1〜3ポイント程度です。
AI文字起こしの費用は分あたりいくらですか?
主要なAI文字起こしサービスは分あたり$0.05〜$0.25が相場です。人力文字起こしは$0.72〜$1.50/分なので5〜20倍の差があります。AIの出力に集中的な人手修正($0.30〜$0.50/分)を加えても、多くのワークフローでは全文人力より安く済みます。
リアルタイム文字起こしとバッチ処理はどちらが精度が高いですか?
バッチ処理の方が通常3〜5ポイント精度が高いです。リアルタイムではまだ発話されていない音声を先読みして曖昧さを解消できないためです。会議後にだけトランスクリプトが必要なら、バッチ処理を選ぶ方が出力品質が高くなります。
話者分離(ダイアリゼーション)はどれほど信頼できますか?
2〜3名の録音では話者分離精度90〜95%を期待できます。6名以上では1時間の録音につき10〜15分の手動修正が必要になることが多いです。多くのサービスが「話者識別」と表現していますが、実際には声紋の事前登録なしの「クラスタリング」に過ぎません。
WER(単語誤り率)5%とはどういう意味ですか?
60分の会議(約9,000単語)でWER 5%なら、トランスクリプト全体に約450個の誤りが散在することを意味します。アーカイブや検索目的なら十分な品質ですが、発言を特定の人物に直接引用する場合は手動確認が必要になります。