使い方
- 動画をドロップします。
- 言語は自動検出のままにするか、英語字幕にするなら「英語に翻訳」を選びます。
- 文字起こしして、動画を見ながら各行を修正し、SRT または VTT でダウンロードします。
上に MP4, MOV, WebM の動画をドロップすると、数秒から数分でタイミング付きの SRT 字幕ができます。音声認識はブラウザ内で動作するため、動画がアップロードされることはなく、長さの制限もアカウントも不要です。
得られるもの
- これは形式の変換ではなく音声認識です。動画の音声を聞き取り、話された内容を句読点付きで書き起こします。
- SRT の各字幕は発話に合わせてタイミング調整され、読みやすく保たれます。放送局の字幕と同じく、1 行約 42 文字で最大 2 行です。
- 約 100 言語を自動で検出します。音声を英語に翻訳することもできます。
- はっきりした話し声ならほぼ完璧に書き起こせます。背景の雑音、複数人の同時発話、珍しい固有名詞は誤りの原因になりますが、ダウンロード前にその場で修正できます。
- 話者は区別されません。テキストには誰が話したかではなく、何が話されたかが記録されます。
用途
動画に字幕を付けるには SRT を使います:あらゆる動画プレーヤー向けの字幕。字幕があれば音声をオフにしても動画を楽しめます(多くの人はそうしてスクロールしています)。また、話されている言葉を検索エンジンに伝えられます。
何もアップロードされないため、医療、法律、人事面接などの機密性の高い録音や、個人的なボイスメモにも安心して使えます。
よくある質問
MP4, MOV, WebM ファイルはアップロードされますか?
いいえ。音声認識は一度だけブラウザにダウンロードされ、そこで動作します。録音そのものがデバイスから出ることはありません。読み込み後はオフラインにしても動作します。
精度はどのくらいですか?
はっきりした声なら、Accurate はほとんど間違えません。Fast は間違いが多めですがどのスマートフォンでも動作し、Balanced はその中間です。ダウンロード前にすべての行を修正できます。
どのくらい時間がかかりますか?
最近のパソコンなら、1 分間の音声は Fast や Accurate で数秒、Balanced ではもう少しかかります。スマートフォンではより時間がかかります。無音部分はスキップされるため、間の多い長い録音は長さの割に早く終わります。
初回にダウンロードがあるのはなぜですか?
デバイス上で音声認識を行うには、認識機能自体をダウンロードする必要があります:Fast は 80 MB、Balanced は 245 MB、Accurate は 545 MB です。ブラウザに保存されるため、次回以降の文字起こしはすぐに始まります。
どの言語に対応していますか?
英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語、オランダ語、アラビア語、中国語、日本語、ロシア語など、約 100 言語に対応しています。言語は自動で検出されますが、手動で指定することもできます。
無料ですか? 長さの制限はありますか?
無料でアカウント不要、時間の制限もありません。処理はお使いのデバイスで行われるため、計測するものがないのです。非常に長い録音でも、制限となるのはデバイスのメモリだけです。