使い方
- WhatsApp からボイスメッセージを保存します(方法は下記を参照)。
- .opus、.ogg、.m4a ファイルをここにドロップします。
- 数秒後に表示されるテキストを読み、コピーまたはダウンロードします。
上に WhatsApp のボイスメッセージ の録音をドロップすると、数秒から数分でテキストになります。音声認識はブラウザ内で動作するため、音声がアップロードされることはなく、長さの制限もアカウントも不要です。
得られるもの
- これは形式の変換ではなく音声認識です。録音を聞き取り、話された内容を句読点付きで書き起こします。
- テキストは間の部分で段落に分けられます。タイムスタンプは画面上に表示され、SRT と VTT の書き出しにも含まれます。
- 約 100 言語を自動で検出します。音声を英語に翻訳することもできます。
- はっきりした話し声ならほぼ完璧に書き起こせます。背景の雑音、複数人の同時発話、珍しい固有名詞は誤りの原因になりますが、ダウンロード前にその場で修正できます。
- 話者は区別されません。テキストには誰が話したかではなく、何が話されたかが記録されます。
用途
メモ、議事録、インタビューの引用、今は聞けないボイスメッセージなど、検索・コピー・翻訳したいものにはプレーンテキストが便利です。
何もアップロードされないため、医療、法律、人事面接などの機密性の高い録音や、個人的なボイスメモにも安心して使えます。
よくある質問
WhatsApp からボイスメッセージのファイルを取り出すには?
iPhone:ボイスメッセージを長押しして「転送」を選び、共有アイコンをタップして「"ファイル"に保存」を選びます。Android:メッセージを長押しして「共有」(または 3 点メニューから「共有」)をタップし、ファイルに保存します。受信したボイスメッセージは WhatsApp/Media/WhatsApp Voice Notes フォルダにもあります。パソコン版 WhatsApp または WhatsApp Web:メッセージにカーソルを合わせてメニューを開き、「ダウンロード」を選びます。
WhatsApp のボイスメッセージはどんな形式ですか?
Opus 音声で、通常は .opus または .ogg として保存されます。どちらもここで直接読み込めます。ボイスメッセージを事前に変換していた場合は、.m4a や .mp3 も読み込めます。
WhatsApp のボイスメッセージを直接文字起こしできますか?
Android なら可能です。AnyFileFormat をアプリとしてインストールし(このページのボタンから)、WhatsApp または Telegram でボイスメッセージを長押しして「共有」をタップし、AnyFileFormat を選びます。文字起こしはスマートフォン上で自動的に始まります。iPhone ではまだ Web アプリが共有ファイルを受け取れないため、先にメッセージを「ファイル」アプリに保存してください。
文字起こししたことは送信者に伝わりますか?
いいえ。WhatsApp にも他の誰にも何も送信されません。ファイルはブラウザ内で読み込まれ、文字起こしされます。
WhatsApp のボイスメッセージ ファイルはアップロードされますか?
いいえ。音声認識は一度だけブラウザにダウンロードされ、そこで動作します。録音そのものがデバイスから出ることはありません。読み込み後はオフラインにしても動作します。
精度はどのくらいですか?
はっきりした声なら、Accurate はほとんど間違えません。Fast は間違いが多めですがどのスマートフォンでも動作し、Balanced はその中間です。ダウンロード前にすべての行を修正できます。
どのくらい時間がかかりますか?
最近のパソコンなら、1 分間の音声は Fast や Accurate で数秒、Balanced ではもう少しかかります。スマートフォンではより時間がかかります。無音部分はスキップされるため、間の多い長い録音は長さの割に早く終わります。
初回にダウンロードがあるのはなぜですか?
デバイス上で音声認識を行うには、認識機能自体をダウンロードする必要があります:Fast は 80 MB、Balanced は 245 MB、Accurate は 545 MB です。ブラウザに保存されるため、次回以降の文字起こしはすぐに始まります。
どの言語に対応していますか?
英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語、オランダ語、アラビア語、中国語、日本語、ロシア語など、約 100 言語に対応しています。言語は自動で検出されますが、手動で指定することもできます。
無料ですか? 長さの制限はありますか?
無料でアカウント不要、時間の制限もありません。処理はお使いのデバイスで行われるため、計測するものがないのです。非常に長い録音でも、制限となるのはデバイスのメモリだけです。