音声をテキストに変換する方法(速く、しかもほぼ無料で)
手元に録音がある。インタビュー、講義、ボイスメモ。それをテキストにしたい。そこに至る方法はちょうど4つあり、正しいものを選べば、何時間かお金かのどちらかを節約できます。まずは正直な比較、続いて多くの人にとっての最速ルートを示します。
4つの選択肢
1. 自分で入力する。 無料だが、つらいほど遅い。音声1時間あたり入力3〜4時間を見込んでください。なまりで巻き戻すとさらに増えます。完璧に仕上げたい2分のクリップにだけ割に合います。
2. 無料/DIYツール。 YouTubeの自動字幕、スマホの音声入力、Zoomの文字起こし。費用ゼロですが、長さに上限があり、なまりでつまずき、要約も字幕もきれいなエクスポートもありません。おおまかな内容をつかむには十分です。
3. AI文字起こし。 ファイルをアップロードすれば、90〜97%の精度できれいなテキストが数分で返ってきます。字幕、要約、翻訳も付きます。録音1件あたり数セントから数ドル。ほぼ誰にとっても最適解です。
4. 人手のサービス。 難しい音声で最も正確ですが、1分あたり約1〜2ドル、納期は数時間から数日。法的記録や放送水準の逐語起こしのために取っておきましょう。
最速ルート:AI文字起こしを一歩ずつ
ふつうの録音なら、ワークフロー全体は次のとおりで、あなたの手間は1分ほどです。
- ファイルをアップロード。 音声でも動画でもドラッグ&ドロップ。MP3、M4A、WAV、MP4、MOV、WEBM。Speechoならアカウントなしでゲストのまま始められます。
- 言語を選ぶ(99言語にわたる自動検出に任せてもOK)。複数人が話しているなら話者識別をオンに。
- AIに任せる。 短いファイルはたいてい1分以内、長いインタビューでも数分です。
- 4つの成果物を一度に入手 — きれいな文字起こし、字幕ファイル(.srt/.vtt)、アクションアイテム付きのワンクリックAI要約、18言語への翻訳。
- エクスポート。 プレーンテキスト、Word、PDF、あるいはそのままメモに貼り付け。
最もきれいな結果を得るには
どんな設定よりも、いくつかの習慣のほうが文字起こしに効きます。
- 静かな部屋で録音し、話し手にマイクを近づける。これはあらゆる後処理の小技に勝ります。
- インタビューでは話者ラベルを使い、区切りのない塊ではなく「話者1/話者2」の対話にする。
- まずAI要約を読み、丁寧に校正すべき箇所を見つける。
- 固有名詞を拾い読みする。 数少ない実際の誤りは、名前や略語に潜んでいます。
費用はどれくらいか
ときどき使うならAIが勝つ理由は、その料金モデルにあります。月額の文字起こしサブスクは、使っても使わなくても10〜20ドルを請求します。従量課金なら、90分のインタビュー1件で約1.50ドル、翌月に録音しなければ支払いはゼロです。Speechoではクレジットが失効しないので、少し多めに買っても無駄になりません。詳しくは料金の内訳をご覧ください。
自分の録音で試す準備はできましたか。最初のファイルを無料で文字起こし。15分ぶん込み、カード登録は不要です。