Jak to zrobić
- Upuść plik audio lub wideo.
- Zostaw automatyczne wykrywanie języka i wybierz tryb: Fast, Balanced lub Accurate.
- Transkrybuj, poprawiaj dowolne słowo na miejscu, potem skopiuj tekst lub pobierz TXT, SRT albo VTT.
Upuść nagranie dźwięk powyżej, a dostaniesz jego tekst w kilka sekund lub minut. Rozpoznawanie mowy działa w przeglądarce: dźwięk nigdy nie jest wysyłany, bez limitu długości i bez konta.
Co otrzymujesz
- To rozpoznawanie mowy, nie zmiana formatu: słucha nagrania i zapisuje, co zostało powiedziane, z interpunkcją i wielkimi literami.
- Tekst jest dzielony na akapity w miejscach przerw. Znaczniki czasu pozostają na ekranie oraz w eksportach SRT i VTT.
- Około stu języków, wykrywanych automatycznie. Może też przetłumaczyć mowę na angielski.
- Wyraźna mowa wychodzi niemal bezbłędnie. Szum w tle, ludzie mówiący jednocześnie i rzadkie nazwy powodują błędy, które możesz poprawić na miejscu przed pobraniem.
- Mówcy nie są oznaczani: tekst mówi, co powiedziano, a nie kto to powiedział.
Do czego służy
Użyj zwykłego tekstu do notatek, protokołów, cytatów z wywiadu, wiadomości głosowej, której nie możesz teraz odsłuchać, albo czegokolwiek, co chcesz przeszukiwać, kopiować lub tłumaczyć.
Ponieważ nic nie jest wysyłane, nadaje się do poufnych nagrań: medycznych, prawnych, rozmów rekrutacyjnych czy prywatnych notatek głosowych.
Najczęstsze pytania
Czy mój plik dźwięk jest wysyłany?
Nie. Rozpoznawanie mowy jest raz pobierane do przeglądarki i tam działa. Samo nagranie nigdy nie opuszcza urządzenia: po załadowaniu możesz przejść w tryb offline i nadal działa.
Jak jest dokładna?
Przy wyraźnym głosie Accurate popełnia bardzo mało błędów; Fast popełnia ich więcej, ale działa na każdym telefonie, a Balanced jest pośrodku. Każdy wiersz można poprawić przed pobraniem.
Ile to trwa?
Na nowym komputerze minuta mowy zajmuje kilka sekund w trybie Fast lub Accurate i nieco dłużej w Balanced. Telefony są wolniejsze. Cisza jest pomijana, więc długie nagranie z przerwami idzie szybciej, niż sugeruje jego długość.
Dlaczego za pierwszym razem coś się pobiera?
Rozpoznawanie mowy na urządzeniu oznacza pobranie samego rozpoznawania: 80 MB dla Fast, 245 MB dla Balanced, 545 MB dla Accurate. Zostaje w przeglądarce, więc kolejne transkrypcje ruszają od razu.
Jakie języki są obsługiwane?
Około stu, w tym angielski, francuski, hiszpański, niemiecki, włoski, portugalski, niderlandzki, arabski, chiński, japoński i rosyjski. Język jest wykrywany automatycznie; możesz też ustawić go samodzielnie.
Czy to jest darmowe? Czy jest limit długości?
Za darmo, bez konta i bez limitu minut: pracę wykonuje twoje urządzenie, więc nie ma czego liczyć. Bardzo długie nagrania ogranicza jedynie pamięć twojego urządzenia.