Automatycznie twórz napisy do wideo

Na wejściu MP4, MOV, MKV, WebM; na wyjściu zsynchronizowane napisy SRT lub VTT, gotowe do YouTube, Premiere, DaVinci Resolve lub odtwarzacza. Tworzone na twoim urządzeniu.

🔒 Rozpoznawanie mowy działa w przeglądarce. Pobierane jest tylko raz; twoje nagranie nigdzie nie jest wysyłane.

Jak to zrobić

  1. Upuść wideo.
  2. Zostaw automatyczne wykrywanie języka albo wybierz „Przetłumaczony na angielski”, aby uzyskać angielskie napisy.
  3. Transkrybuj, poprawiaj dowolny wiersz podczas oglądania, potem pobierz SRT lub VTT.

Upuść wideo MP4, MOV, WebM powyżej, a dostaniesz zsynchronizowane napisy SRT w kilka sekund lub minut. Rozpoznawanie mowy działa w przeglądarce: wideo nigdy nie jest wysyłane, bez limitu długości i bez konta.

Co otrzymujesz

  • To rozpoznawanie mowy, nie zmiana formatu: słucha ścieżki dźwiękowej wideo i zapisuje, co zostało powiedziane, z interpunkcją i wielkimi literami.
  • Każdy napis SRT jest zsynchronizowany z mową i pozostaje czytelny: najwyżej dwa wiersze po około 42 znaki, tak jak robią to stacje telewizyjne.
  • Około stu języków, wykrywanych automatycznie. Może też przetłumaczyć mowę na angielski.
  • Wyraźna mowa wychodzi niemal bezbłędnie. Szum w tle, ludzie mówiący jednocześnie i rzadkie nazwy powodują błędy, które możesz poprawić na miejscu przed pobraniem.
  • Mówcy nie są oznaczani: tekst mówi, co powiedziano, a nie kto to powiedział.

Do czego służy

Użyj SRT, aby dodać napisy do wideo: napisów do każdego odtwarzacza. Napisy sprawiają, że wideo da się oglądać bez dźwięku, tak jak ogląda większość ludzi, i dają wyszukiwarkom słowa, które w nim padają.

Ponieważ nic nie jest wysyłane, nadaje się do poufnych nagrań: medycznych, prawnych, rozmów rekrutacyjnych czy prywatnych notatek głosowych.

Najczęstsze pytania

Czy mój plik MP4, MOV, WebM jest wysyłany?

Nie. Rozpoznawanie mowy jest raz pobierane do przeglądarki i tam działa. Samo nagranie nigdy nie opuszcza urządzenia: po załadowaniu możesz przejść w tryb offline i nadal działa.

Jak jest dokładna?

Przy wyraźnym głosie Accurate popełnia bardzo mało błędów; Fast popełnia ich więcej, ale działa na każdym telefonie, a Balanced jest pośrodku. Każdy wiersz można poprawić przed pobraniem.

Ile to trwa?

Na nowym komputerze minuta mowy zajmuje kilka sekund w trybie Fast lub Accurate i nieco dłużej w Balanced. Telefony są wolniejsze. Cisza jest pomijana, więc długie nagranie z przerwami idzie szybciej, niż sugeruje jego długość.

Dlaczego za pierwszym razem coś się pobiera?

Rozpoznawanie mowy na urządzeniu oznacza pobranie samego rozpoznawania: 80 MB dla Fast, 245 MB dla Balanced, 545 MB dla Accurate. Zostaje w przeglądarce, więc kolejne transkrypcje ruszają od razu.

Jakie języki są obsługiwane?

Około stu, w tym angielski, francuski, hiszpański, niemiecki, włoski, portugalski, niderlandzki, arabski, chiński, japoński i rosyjski. Język jest wykrywany automatycznie; możesz też ustawić go samodzielnie.

Czy to jest darmowe? Czy jest limit długości?

Za darmo, bez konta i bez limitu minut: pracę wykonuje twoje urządzenie, więc nie ma czego liczyć. Bardzo długie nagrania ogranicza jedynie pamięć twojego urządzenia.