Chuyển lời nói trong bản ghi âm của bạn thành văn bản một cách dễ dàng.
hoặc thả, dán, hoặc chọn từ đám mây
Tự động phát hiện xử lý hầu hết bản ghi. Bạn cũng có thể tự đặt ngôn ngữ trong hơn 90 lựa chọn. Điều này giúp các đoạn ngắn hoặc nhiều tạp âm không bị nhận nhầm ngôn ngữ.
Tải bản chép lại dưới dạng tệp TXT để dán vào tài liệu. Hoặc lấy tệp SRT có dấu thời gian mà trình phát video có thể tải làm phụ đề.
Trình chuyển đổi chạy trong trình duyệt trên mọi thiết bị. Dữ liệu được mã hóa và bản ghi của bạn không bao giờ được chia sẻ với bất kỳ ai.
Tải tệp âm thanh của bạn lên.
Chọn ngôn ngữ được nói trong tệp âm thanh của bạn.
Nhấp vào nút "START" để bắt đầu chuyển đổi.
Tải tệp văn bản xuống.
Speech to Text là một công cụ trực tuyến miễn phí, tự động chuyển lời nói trong bản ghi âm của bạn thành văn bản. Tính năng này có thể giúp bạn tiết kiệm hàng giờ gõ lại thủ công, hữu ích cho nhà báo, nhà nghiên cứu, sinh viên và người dùng trong doanh nghiệp. Dù bạn cần chép lại phỏng vấn, bài giảng hay cuộc họp, tính năng Speech to Text của chúng tôi giúp thực hiện nhanh chóng và đơn giản.
Nó còn được gọi là nhận dạng giọng nói, chuyển lời nói thành văn bản tự động, hoặc đơn giản là audio to text. Một mô hình nhận dạng sẽ nghe bản ghi và chia nhỏ thành các đơn vị âm thanh. Sau đó, nó đối chiếu chúng với các mẫu đã học từ hàng nghìn giờ giọng nói được ghi âm.
Kết quả là một bản chép lại mà bạn có thể đọc, tìm kiếm, trích dẫn và chỉnh sửa. Không có gì được gõ tay, nên một cuộc phỏng vấn một giờ chỉ mất vài phút thay vì cả buổi chiều.
Độ chính xác phụ thuộc chủ yếu vào chính bản ghi. Giọng nói rõ ràng, một người nói tại một thời điểm và ít tiếng ồn nền sẽ cho bản chép lại tốt nhất. Bản ghi từ điện thoại ở phía bên kia một căn phòng ồn ào sẽ luôn khó đọc hơn bản ghi từ tai nghe.
Đặt đúng ngôn ngữ nói thay vì để tự động là cách dễ nhất để cải thiện. Tự động phát hiện có thể đoán sai với đoạn ngắn, giọng mạnh hoặc khi 2 ngôn ngữ xuất hiện trong cùng một tệp. Một lần đoán sai có thể ảnh hưởng đến mọi dòng phía sau.
Cài đặt tốc độ xử lý quyết định phần còn lại của cân bằng. Mô hình nhanh trả kết quả sớm hơn, trong khi mô hình chậm đọc audio kỹ hơn và nhận đúng nhiều từ hơn. Hãy chọn mô hình chậm hơn khi bản ghi dài, nhỏ tiếng hoặc mang tính kỹ thuật.
Các định dạng âm thanh phổ biến đều dùng được, bao gồm MP3, WAV, M4A, FLAC, OGG và AAC. Hỗ trợ xử lý hàng loạt, nên bạn có thể thêm nhiều bản ghi cùng lúc và nhận một bản chép lại riêng cho từng bản.
Có hai định dạng đầu ra. TXT là văn bản thuần, sẵn sàng để dán vào tài liệu hoặc ứng dụng ghi chú. SRT chia cùng văn bản đó thành các dòng phụ đề có thời gian, là định dạng mà trình phát và trình chỉnh sửa video mong đợi.
Hơn 90 ngôn ngữ nói được hỗ trợ, gồm tiếng Ả Rập, Trung, Hà Lan, Pháp, Đức, Hindi, Ý, Nhật, Hàn, Ba Lan, Bồ Đào Nha, Nga, Tây Ban Nha, Thổ Nhĩ Kỳ, Ukraina và Việt Nam.
Có. Tải bản ghi lên, bắt đầu chuyển đổi và tải bản chép lại xuống mà không phải trả phí và không cần tạo tài khoản. Gói đăng ký chỉ cần thiết cho bản ghi dài và khối lượng sử dụng lớn mỗi ngày.
Tùy thuộc vào việc audio của bạn đang ở đâu. Ứng dụng đọc chính tả sẽ gõ những gì bạn nói vào micro khi bạn đang nói. Trang này làm nhiệm vụ còn lại: nhận bản ghi bạn đã có sẵn và trả về một tệp văn bản. Nếu audio tồn tại dưới dạng tệp, trình chuyển đổi như thế này sẽ là cách nhanh hơn.
Google Cloud Speech-to-Text là một API dành cho nhà phát triển, và Google Docs cung cấp tính năng nhập liệu bằng giọng nói theo thời gian thực. Cả hai đều không cho phép bạn thả một tệp audio có sẵn vào trang trình duyệt và tải bản chép lại xuống. Trình chuyển đổi này có, không cần mã và không cần tài khoản.
Giọng nói rõ ràng, một người nói và ít tiếng ồn nền cho kết quả tốt nhất. Chọn đúng ngôn ngữ nói thay vì tự động phát hiện sẽ loại bỏ một nguồn lỗi phổ biến, và cài đặt tốc độ xử lý chậm hơn sẽ đọc audio kỹ hơn. Hãy dự tính sẽ phải rà soát lại tên riêng, thuật ngữ và con số.
Hơn 90 ngôn ngữ, bao gồm tiếng Ả Rập, Trung, Hà Lan, Pháp, Đức, Hindi, Ý, Nhật, Hàn, Ba Lan, Bồ Đào Nha, Nga, Tây Ban Nha, Thổ Nhĩ Kỳ, Ukraina và Việt Nam. Để cài đặt ở chế độ tự động và ngôn ngữ sẽ được nhận diện từ audio.
Các tệp âm thanh phổ biến đều dùng được, bao gồm MP3, WAV, M4A, FLAC, OGG và AAC. Có thể tải lên nhiều tệp cùng lúc, và mỗi tệp sẽ được trả về dưới dạng một bản chép lại riêng.
Có. Chọn SRT làm định dạng đầu ra và bản chép lại sẽ được trả về dưới dạng các dòng phụ đề có thời gian mà trình phát hoặc trình chỉnh sửa video có thể tải trực tiếp. Chọn TXT để nhận tệp văn bản thuần.
Có. Mở trang này trong trình duyệt trên điện thoại và chọn bản ghi từ điện thoại hoặc từ bộ nhớ đám mây. Không có ứng dụng nào cần cài đặt và các bước giống như trên máy tính.
Everything here runs in the browser, with no install and no sign-up.