Thả video TS vào phía trên và bạn sẽ nhận được phụ đề VTT có mốc thời gian sau vài giây đến vài phút. Nhận dạng giọng nói chạy trong trình duyệt: video không bao giờ được tải lên, không giới hạn thời lượng, không cần tài khoản.
Bạn nhận được gì
- Đây là nhận dạng giọng nói, không phải đổi định dạng: công cụ nghe âm thanh của video và viết lại những gì được nói, có dấu câu và chữ hoa.
- Mỗi dòng phụ đề VTT được căn theo lời nói và dễ đọc: tối đa hai dòng, mỗi dòng khoảng 42 ký tự, giống cách các đài truyền hình làm phụ đề.
- Khoảng một trăm ngôn ngữ, được phát hiện tự động. Cũng có thể dịch lời nói sang tiếng Anh.
- Giọng nói rõ ràng cho kết quả gần như hoàn hảo. Tiếng ồn nền, nhiều người nói chồng lên nhau và tên riêng hiếm gặp có thể gây lỗi, nhưng bạn có thể sửa trực tiếp trước khi tải xuống.
- Người nói không được đánh dấu: văn bản ghi lại nội dung được nói, không ghi ai nói.
Khi nào nên chuyển đổi, và khi nào không
Dùng VTT để thêm phụ đề cho video: video trên trang web. Phụ đề giúp xem được video khi tắt tiếng, đó là cách hầu hết mọi người lướt xem, và cung cấp cho công cụ tìm kiếm những lời được nói trong video.
Vì không có gì được tải lên, công cụ phù hợp với các bản ghi âm bảo mật: y tế, pháp lý, phỏng vấn nhân sự hoặc ghi chú thoại cá nhân.
Cách thực hiện
- Thả tệp TS vào phía trên, hoặc nhấn để chọn.
- Để ngôn ngữ ở chế độ tự động phát hiện và chọn một chế độ: Fast chạy được ở mọi nơi, Accurate cho kết quả tốt nhất trên máy tính có trình duyệt mới.
- Nhấn Chép lời. Theo dõi văn bản khi nó xuất hiện, nhấn vào bất kỳ từ nào để sửa, rồi tải xuống VTT.
Câu hỏi
Tệp TS của tôi có bị tải lên không?
Không. Công cụ nhận dạng giọng nói được tải về trình duyệt một lần và chạy tại đó. Bản ghi không bao giờ rời khỏi thiết bị: sau khi tải xong, bạn có thể ngắt mạng mà vẫn dùng được.
Độ chính xác thế nào?
Với giọng nói rõ ràng, Accurate rất ít khi sai; Fast sai nhiều hơn nhưng chạy được trên mọi điện thoại, còn Balanced nằm ở giữa. Mọi dòng đều có thể sửa trước khi tải xuống.
Mất bao lâu?
Trên máy tính đời mới, một phút lời nói mất vài giây với Fast hoặc Accurate, lâu hơn một chút với Balanced. Điện thoại chậm hơn. Các đoạn im lặng được bỏ qua, nên bản ghi dài có nhiều khoảng lặng sẽ xử lý nhanh hơn so với thời lượng.
Vì sao lần đầu lại có một lượt tải xuống?
Nhận dạng giọng nói trên thiết bị đồng nghĩa với việc tải công cụ nhận dạng về: 80 MB cho Fast, 245 MB cho Balanced, 545 MB cho Accurate. Công cụ được lưu trong trình duyệt, nên những lần chép lời sau sẽ bắt đầu ngay.
Hỗ trợ những ngôn ngữ nào?
Khoảng một trăm ngôn ngữ, bao gồm tiếng Việt, tiếng Anh, tiếng Pháp, tiếng Tây Ban Nha, tiếng Đức, tiếng Ý, tiếng Bồ Đào Nha, tiếng Hà Lan, tiếng Ả Rập, tiếng Trung, tiếng Nhật và tiếng Nga. Ngôn ngữ được phát hiện tự động; bạn cũng có thể tự chọn.
Có miễn phí không? Có giới hạn thời lượng không?
Miễn phí, không cần tài khoản và không giới hạn số phút: thiết bị của bạn làm mọi việc, nên không có gì để tính phí. Bản ghi rất dài chỉ bị giới hạn bởi bộ nhớ thiết bị.