위에 WMA 동영상을 끌어다 놓으면 몇 초에서 몇 분 안에 타이밍이 맞춰진 VTT 자막을 받을 수 있습니다. 음성 인식은 브라우저에서 실행됩니다. 동영상은 업로드되지 않으며, 길이 제한도 계정도 없습니다.
결과물
- 형식 변환이 아니라 음성 인식입니다: 녹음을 듣고 말한 내용을 문장 부호까지 넣어 받아 적습니다.
- 모든 VTT 자막은 음성에 맞춰 타이밍이 조정되고 읽기 쉽게 유지됩니다: 방송 자막처럼 한 줄 약 42자, 최대 두 줄.
- 약 100개 언어를 자동으로 감지합니다. 음성을 영어로 번역할 수도 있습니다.
- 또렷한 음성은 거의 완벽하게 받아 적습니다. 배경 소음, 여러 사람이 동시에 말하는 부분, 드문 이름에서는 오류가 생길 수 있으며, 다운로드 전에 바로 수정할 수 있습니다.
- 화자는 구분되지 않습니다: 텍스트에는 누가 말했는지가 아니라 무엇을 말했는지만 담깁니다.
변환해야 할 때와 하지 말아야 할 때
동영상에 자막을 넣으려면 VTT을(를) 쓰세요: 웹사이트 동영상. 자막이 있으면 대부분의 사람들이 스크롤할 때처럼 소리를 끄고도 동영상을 볼 수 있고, 검색 엔진도 동영상 속 말을 알 수 있습니다.
아무것도 업로드되지 않으므로 의료, 법률, 인사 면담이나 개인 음성 메모처럼 기밀이 필요한 녹음에도 적합합니다.
사용 방법
- 위에 WMA 파일을 끌어다 놓거나, 클릭해서 선택하세요.
- 언어는 자동 감지로 두고 모드를 선택하세요: Fast는 어디서나 작동하고, Accurate는 최신 브라우저를 쓰는 컴퓨터에서 가장 좋습니다.
- 텍스트 변환을 누르세요. 텍스트가 나타나는 대로 읽으면서 단어를 클릭해 수정하고, VTT(으)로 다운로드하세요.
질문
제 WMA 파일이 업로드되나요?
아니요. 음성 인식은 브라우저에 한 번 다운로드되어 그곳에서 실행됩니다. 녹음 파일 자체는 기기 밖으로 나가지 않습니다. 불러온 뒤에는 오프라인 상태에서도 작동합니다.
얼마나 정확한가요?
또렷한 음성이라면 Accurate는 실수가 거의 없습니다. Fast는 실수가 더 많지만 모든 휴대폰에서 실행되며, Balanced는 그 중간입니다. 다운로드 전에 모든 줄을 수정할 수 있습니다.
얼마나 걸리나요?
최신 컴퓨터에서는 1분 분량의 음성이 Fast나 Accurate로 몇 초, Balanced로는 조금 더 걸립니다. 휴대폰은 더 느립니다. 무음 구간은 건너뛰므로, 쉬는 부분이 많은 긴 녹음은 길이에 비해 빨리 끝납니다.
처음에 다운로드가 있는 이유는 무엇인가요?
기기에서 음성을 인식하려면 인식 엔진을 다운로드해야 합니다: Fast는 80 MB, Balanced는 245 MB, Accurate는 545 MB입니다. 브라우저에 저장되므로 다음 변환부터는 바로 시작됩니다.
어떤 언어를 지원하나요?
영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 아랍어, 중국어, 일본어, 러시아어 등 약 100개 언어를 지원합니다. 언어는 자동으로 감지되며, 직접 지정할 수도 있습니다.
무료인가요? 길이 제한이 있나요?
계정도 필요 없고 시간 제한도 없이 무료입니다: 작업은 기기가 처리하므로 측정할 것이 없습니다. 아주 긴 녹음은 기기의 메모리에 따라서만 제한됩니다.