Chuyển giọng nói thành văn bản

Chuyển giọng nói thành văn bản

Định nghĩa

Chuyển giọng nói thành văn bản (STT) là quá trình tự động chuyển đổi ngôn ngữ nói thành văn bản viết bằng các mô hình AI. Quá trình này liên quan chặt chẽ đến ASR.

Mục đích

Mục đích là giúp nội dung nói dễ tiếp cận và dễ tìm kiếm. Nó được sử dụng rộng rãi trong phiên âm, trợ năng và trợ lý kỹ thuật số.

Tầm quan trọng

  • Hỗ trợ khả năng truy cập cho người dùng khiếm thính.
  • Cung cấp bản ghi chép cho các cuộc họp và bài giảng.
  • Độ chính xác phụ thuộc vào giọng và điều kiện tiếng ồn.
  • Được sử dụng trong hầu hết các ứng dụng điều khiển bằng giọng nói.

Quy trình triển khai

  1. Ghi lại âm thanh đầu vào.
  2. Tiền xử lý và chuẩn hóa tín hiệu âm thanh.
  3. Áp dụng mô hình ASR để nhận dạng từ.
  4. Xuất ra bản ghi văn bản.
  5. Xem xét hoặc sửa chữa dưới sự giám sát của con người nếu cần.

Ví dụ (Thực tế)

  • API chuyển giọng nói thành văn bản của Google Cloud.
  • Dịch vụ giọng nói Microsoft Azure.
  • Bản ghi cuộc họp Otter.ai.

Tài liệu tham khảo / Đọc thêm

Hãy cho chúng tôi biết cách chúng tôi có thể trợ giúp với sáng kiến ​​AI tiếp theo của bạn.