上に WMV の動画をドロップすると、数秒から数分でタイミング付きの VTT 字幕ができます。音声認識はブラウザ内で動作するため、動画がアップロードされることはなく、長さの制限もアカウントも不要です。
得られるもの
- これは形式の変換ではなく音声認識です。動画の音声を聞き取り、話された内容を句読点付きで書き起こします。
- VTT の各字幕は発話に合わせてタイミング調整され、読みやすく保たれます。放送局の字幕と同じく、1 行約 42 文字で最大 2 行です。
- 約 100 言語を自動で検出します。音声を英語に翻訳することもできます。
- はっきりした話し声ならほぼ完璧に書き起こせます。背景の雑音、複数人の同時発話、珍しい固有名詞は誤りの原因になりますが、ダウンロード前にその場で修正できます。
- 話者は区別されません。テキストには誰が話したかではなく、何が話されたかが記録されます。
変換すべきとき、すべきでないとき
動画に字幕を付けるには VTT を使います:Web サイトの動画。字幕があれば音声をオフにしても動画を楽しめます(多くの人はそうしてスクロールしています)。また、話されている言葉を検索エンジンに伝えられます。
何もアップロードされないため、医療、法律、人事面接などの機密性の高い録音や、個人的なボイスメモにも安心して使えます。
手順
- 上に WMV ファイルをドロップするか、クリックして選択します。
- 言語は自動検出のまま、モードを選びます。Fast はどこでも動作し、Accurate は最新ブラウザを搭載したパソコンで最も高精度です。
- 「文字起こし」をクリックします。表示されるテキストを確認しながら、クリックして単語を修正し、VTT でダウンロードします。
質問
WMV ファイルはアップロードされますか?
いいえ。音声認識は一度だけブラウザにダウンロードされ、そこで動作します。録音そのものがデバイスから出ることはありません。読み込み後はオフラインにしても動作します。
精度はどのくらいですか?
はっきりした声なら、Accurate はほとんど間違えません。Fast は間違いが多めですがどのスマートフォンでも動作し、Balanced はその中間です。ダウンロード前にすべての行を修正できます。
どのくらい時間がかかりますか?
最近のパソコンなら、1 分間の音声は Fast や Accurate で数秒、Balanced ではもう少しかかります。スマートフォンではより時間がかかります。無音部分はスキップされるため、間の多い長い録音は長さの割に早く終わります。
初回にダウンロードがあるのはなぜですか?
デバイス上で音声認識を行うには、認識機能自体をダウンロードする必要があります:Fast は 80 MB、Balanced は 245 MB、Accurate は 545 MB です。ブラウザに保存されるため、次回以降の文字起こしはすぐに始まります。
どの言語に対応していますか?
英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語、オランダ語、アラビア語、中国語、日本語、ロシア語など、約 100 言語に対応しています。言語は自動で検出されますが、手動で指定することもできます。
無料ですか? 長さの制限はありますか?
無料でアカウント不要、時間の制限もありません。処理はお使いのデバイスで行われるため、計測するものがないのです。非常に長い録音でも、制限となるのはデバイスのメモリだけです。