2026年のAI文字起こしはどこまで正確か。正直に答えます
手短に言うと、現在のAI文字起こしはクリーンな音声で90〜97%の単語精度に収まり、音声が乱れるほどそこから下がっていきます。これは作業時間を何時間も節約できる水準であり、同時に、読み直しなしでそのまま公開できる水準ではありません。「99%の精度」という単一の数値を掲げる相手は、測定しているのではなく売り込んでいます。
実際にあなたが得る数値を決めるのは何か、以下で説明します。
そもそも「精度」とは何か
業界では文字起こしの品質を**単語誤り率(WER)**で測ります。これはモデルが誤った単語の割合で、挿入・削除・置換のいずれであっても誤りとしてカウントします。WER 5%は精度95%を意味し、おおよそ20語に1語が誤りです。5,000語のインタビューなら約250か所の修正になりますが、そのほとんどは些細なもの(抜けた「the」、「gonna」が「going to」と書かれる等)で、数秒で直せます。
つまり「精度97%」は、あなたの文字起こしの97%がそのまま使えるという意味ではありません。骨組みは正しく、あなたは書き直しではなく校正をしているという意味です。この区別こそが価値のすべてです。再生しながらの入力に3〜4時間かけていたものが、15分の手直しで済むようになります。
精度を上げる要因と下げる要因
モデルよりも録音のほうが重要です。実務上、最も大きく効くのは次の要因です。
- 背景ノイズ。 カフェの雑音、エアコン、交通音はどれも単語を食いつぶします。静かな部屋は、文字起こしにできる最も安上がりな改善です。
- マイクとの距離。 会議室の向こう側のテーブルに置いたスマートフォンは、口元から15センチのラペルマイクにはいつも負けます。
- 発話の重なり。 二人が同時に話すと、どのモデルもきれいに分離できません。話者ラベルは助けになりますが、クロストークは業界で最も難しいケースです。
- なまりとコードスイッチング。 強い地域なまりや文中での言語の切り替えは精度を下げますが、その差はかなり縮まりました。
- 専門用語・固有名詞・略語。 固有名詞、薬品名、製品SKU、社内略語こそ、あなたが最も多く編集することになる箇所です。
経験則として、人間が聞き取りに苦労する音声はAIも苦労します。直すべきはモデルではなく音声です。
Whisperと2026年モデルの現在地
SpeechoはOpenAI Whisperで動作しています。これは入手可能な音声認識モデルの中でも最も正確なものの一つで、巨大な多言語データセットで学習されています。クリーンで単一話者の英語なら、この90〜97%の帯域の上限に余裕をもって達し、しかも英語に限らず対応する99言語全体で異例なほど安定しています。この幅広さこそ、多くのツールで既定のエンジンになった理由です。
とはいえ、どんなモデルも難しい音声で完璧ではありません。そこが正直なところです。ノートPCのマイクで録った四人のノイズの多い会議は、きちんとしたオーディオインターフェイスで録ったポッドキャストより下に着地します。エンジンが上限を決め、あなたの録音が下限を決めます。
完璧に近づける方法
その差の大部分は自分で埋められます。
- 静かな場所で録音し、話している人にマイクを近づける。
- インタビューやパネルでは話者識別をオンにして、テキストの塊ではなくラベル付きの対話を編集する。
- 言語がすでに分かっているなら、自動検出に頼らず言語を指定する。
- まず要約を読む。 SpeechoのAI要約とチャプターが要点を浮かび上がらせるので、その箇所が丁寧な校正を要するかどうか判断できます。
- 固有名詞を校正する。 名前・地名・略語が実際の修正の80%です。そこだけ拾い読みすれば完了です。
結論
メモ、字幕、検索可能なアーカイブ、学習用資料、引用の初稿には、2026年のAI文字起こしはすでに働き方を変えられるほど正確です。一言一句そのまま公開するもの、たとえば法的記録や印刷される引用については、文字起こしを素早い初稿とみなして一度読み通してください。そのワークフローは、AIが数秒でこなした録音の上に、ほんの数分の手間を足すだけです。
自分の音声がどこに着地するか見てみたいですか。最初のファイルを無料で文字起こし。15分ぶんを使って実際の録音で試せます。カード登録は不要です。