Nhận dạng giọng nói tự động

Công nghệ chuyển giọng nói thành văn bản là gì và nó hoạt động như thế nào trong tính năng nhận dạng giọng nói tự động

Nhận dạng giọng nói tự động (ASR) đã đi một chặng đường dài. Mặc dù nó đã được phát minh từ lâu nhưng nó hầu như không được ai sử dụng. Tuy nhiên, thời gian và công nghệ hiện nay đã thay đổi đáng kể. Phiên âm âm thanh đã phát triển đáng kể.

Các công nghệ như AI (Trí tuệ nhân tạo) đã hỗ trợ quá trình dịch âm thanh sang văn bản để có kết quả nhanh chóng và chính xác. Do đó, các ứng dụng của nó trong thế giới thực cũng tăng lên, với một số ứng dụng phổ biến như Tik Tok, Spotify và Zoom có ​​thể nhúng quy trình vào ứng dụng di động của họ.

Vì vậy, hãy cùng chúng tôi khám phá ASR và khám phá lý do tại sao nó là một trong những công nghệ phổ biến nhất vào năm 2022.

Lời nói thành văn bản là gì?

Chuyển giọng nói thành văn bản (STT), còn được gọi là nhận dạng giọng nói tự động (ASR), chuyển đổi âm thanh nói thành văn bản viết. Các hệ thống hiện đại là các dịch vụ phần mềm phân tích tín hiệu âm thanh và xuất ra các từ kèm theo dấu thời gian và điểm tin cậy.

Đối với các nhóm xây dựng trung tâm liên lạc, chăm sóc sức khỏe và UX giọng nói, STT là cửa ngõ dẫn đến các cuộc trò chuyện có thể tìm kiếm, phân tích, chú thích hỗ trợ và AI hạ nguồn như tóm tắt hoặc QA.

Tên thông dụng của lời nói thành văn bản

Công nghệ nhận dạng giọng nói tiên tiến này cũng phổ biến và được gọi bằng các tên:

  • Nhận dạng giọng nói tự động (ASR)
  • Nhận dạng giọng nói
  • Nhận dạng giọng nói máy tính
  • Phiên âm
  • Đọc màn hình

Ứng dụng của công nghệ chuyển giọng nói thành văn bản

Trung tâm liên hệ

Bản ghi thời gian thực hỗ trợ trực tiếp cho nhân viên; bản ghi hàng loạt thúc đẩy QA, kiểm toán tuân thủ và lưu trữ cuộc gọi có thể tìm kiếm.

Ví dụ: Sử dụng ASR phát trực tuyến để đưa ra lời nhắc theo thời gian thực trong quá trình tranh chấp thanh toán, sau đó chạy phiên âm hàng loạt sau cuộc gọi để chấm điểm QA và tự động tạo bản tóm tắt.

phù hợp túi tiền

Các bác sĩ lâm sàng ghi chép và nhận tóm tắt cuộc khám; bản ghi chép hỗ trợ mã hóa (CPT/ICD) và ghi chép lâm sàng—luôn tuân thủ các biện pháp bảo vệ PHI.

Ví dụ: Nhà cung cấp ghi lại buổi tư vấn, chạy ASR để soạn thảo ghi chú SOAP và tự động làm nổi bật tên thuốc và các thông số quan trọng để người mã hóa xem xét với việc biên tập PHI được áp dụng.

Truyền thông và giáo dục

Tạo phụ đề cho bài giảng, hội thảo trên web và chương trình phát sóng; thêm phần chỉnh sửa nhẹ khi bạn cần độ chính xác gần như hoàn hảo.

Ví dụ: Một trường đại học sẽ sao chép hàng loạt video bài giảng, sau đó người đánh giá sẽ sửa tên và thuật ngữ chuyên ngành trước khi xuất bản phụ đề dễ hiểu.

Sản phẩm thoại & IVR

Nhận dạng lệnh và từ đánh thức cho phép trải nghiệm người dùng rảnh tay trong các ứng dụng, ki-ốt, phương tiện và thiết bị thông minh; IVR sử dụng bản ghi để định tuyến và giải quyết.

Ví dụ: IVR ngân hàng nhận dạng “đóng băng thẻ của tôi”, xác nhận thông tin chi tiết và kích hoạt quy trình làm việc—không cần điều hướng bằng bàn phím.

Hoạt động & kiến ​​thức

Các cuộc họp và cuộc gọi thực địa sẽ trở thành văn bản có thể tìm kiếm được với dấu thời gian, người nói và các mục hành động để hướng dẫn và phân tích.

Ví dụ: Các cuộc gọi bán hàng được ghi lại, gắn thẻ theo chủ đề (giá cả, phản đối) và tóm tắt; người quản lý lọc theo “rủi ro gia hạn” để lập kế hoạch theo dõi.

Tại sao bạn nên sử dụng tính năng chuyển giọng nói thành văn bản?

  • Làm cho các cuộc trò chuyện có thể được khám phá. Biến nhiều giờ âm thanh thành văn bản có thể tìm kiếm để kiểm tra, đào tạo và thu thập thông tin chi tiết về khách hàng. 
  • Tự động hóa phiên âm thủ công. Giảm thời gian xử lý và chi phí so với quy trình làm việc chỉ có con người thực hiện, đồng thời vẫn duy trì quy trình làm việc của con người để đảm bảo chất lượng hoàn hảo. 
  • AI hạ nguồn. Bản ghi cung cấp tóm tắt, trích xuất ý định/chủ đề, đánh dấu tuân thủ và hướng dẫn. 
  • Cải thiện khả năng tiếp cận. Phụ đề và bản ghi giúp người dùng khiếm thính và cải thiện UX trong môi trường ồn ào. 
  • Hỗ trợ các quyết định theo thời gian thực. ASR phát trực tuyến cho phép hướng dẫn khi gọi, biểu mẫu thời gian thực và giám sát trực tiếp. 

Lợi ích của công nghệ chuyển giọng nói thành văn bản

Tốc độ và chế độ linh hoạt

Phát trực tuyến cung cấp các phần nhỏ hơn một giây để sử dụng trực tiếp; xử lý hàng loạt các dữ liệu tồn đọng với quá trình hậu xử lý phong phú hơn.

Ví dụ: Truyền phát bản ghi để hỗ trợ tác nhân; sao chép lại hàng loạt sau đó để lưu trữ đạt chất lượng QA.

Các tính năng chất lượng được tích hợp sẵn

Nhận nhật ký, dấu câu/cách viết hoa, dấu thời gian và gợi ý cụm từ/từ vựng tùy chỉnh để xử lý thuật ngữ chuyên ngành.

Ví dụ: Nhãn Bác sĩ/Bệnh nhân lần lượt và tăng cường tên thuốc để chúng được phiên âm chính xác.

Lựa chọn triển khai

Sử dụng API đám mây để mở rộng quy mô/cập nhật hoặc container tại chỗ/bên ngoài để lưu trữ dữ liệu và độ trễ thấp.

Ví dụ:Một bệnh viện chạy ASR trong trung tâm dữ liệu của mình để lưu trữ PHI tại chỗ.

Tùy chỉnh & đa ngôn ngữ

Thu hẹp khoảng cách về độ chính xác bằng danh sách cụm từ và khả năng thích ứng theo miền; hỗ trợ nhiều ngôn ngữ và chuyển đổi mã.

Ví dụ:Một ứng dụng công nghệ tài chính thúc đẩy tên thương hiệu và mã chứng khoán bằng tiếng Anh/tiếng Anh-Hindi, sau đó tinh chỉnh các thuật ngữ chuyên ngành.

Hiểu hoạt động của tính năng nhận dạng giọng nói tự động

Quy trình nhận dạng giọng nói

Hoạt động của phần mềm dịch từ âm thanh sang văn bản rất phức tạp và bao gồm việc thực hiện nhiều bước. Như chúng ta đã biết, giọng nói thành văn bản là một phần mềm độc quyền được thiết kế để chuyển đổi các tệp âm thanh thành một định dạng văn bản có thể chỉnh sửa; nó thực hiện điều đó bằng cách tận dụng nhận dạng giọng nói.

Quy trình

  • Ban đầu, bằng cách sử dụng bộ chuyển đổi tương tự sang kỹ thuật số, một chương trình máy tính áp dụng các thuật toán ngôn ngữ vào dữ liệu được cung cấp để phân biệt các rung động từ các tín hiệu thính giác.
  • Tiếp theo, các âm thanh liên quan được lọc bằng cách đo sóng âm thanh.
  • Hơn nữa, các âm thanh được phân phối / phân đoạn thành phần trăm hoặc phần nghìn giây và khớp với âm vị (Một đơn vị âm thanh có thể đo lường để phân biệt từ này với từ khác).
  • Các âm vị được tiếp tục chạy qua một mô hình toán học để so sánh dữ liệu hiện có với các từ, câu và cụm từ nổi tiếng.
  • Đầu ra ở dạng văn bản hoặc tệp âm thanh dựa trên máy tính.

[Cũng đọc: Tổng quan Toàn diện về Nhận dạng Giọng nói Tự động]

Công dụng của lời nói thành văn bản là gì?

Có nhiều cách sử dụng phần mềm nhận dạng giọng nói tự động, chẳng hạn như

  • Tìm kiếm Nội dung: Hầu hết chúng ta đã chuyển từ việc gõ chữ trên điện thoại sang cách nhấn nút để phần mềm nhận dạng giọng nói của chúng ta và đưa ra kết quả mong muốn.
  • Dịch vụ khách hàng: Chatbots và trợ lý AI có thể hướng dẫn khách hàng qua một vài bước ban đầu của quy trình đã trở nên phổ biến.
  • Phụ đề chi tiết theo thời gian thực: Với việc gia tăng khả năng tiếp cận nội dung trên toàn cầu, phụ đề chi tiết trong thời gian thực đã trở thành một thị trường nổi bật và quan trọng, thúc đẩy ASR tiếp tục được sử dụng.
  • Tài liệu Điện tử: Một số bộ phận quản trị đã bắt đầu sử dụng ASR để thực hiện các mục đích tài liệu, phục vụ cho tốc độ và hiệu quả tốt hơn.

Những Thách thức Chính đối với Nhận dạng Giọng nói là gì?

Trọng âm và phương ngữCùng một từ có thể nghe rất khác nhau ở các vùng miền, điều này gây nhầm lẫn cho các mô hình được đào tạo theo giọng nói "chuẩn". Cách khắc phục rất đơn giản: thu thập và kiểm tra bằng âm thanh giàu giọng, đồng thời thêm gợi ý cụm từ/phát âm cho tên thương hiệu, địa điểm và tên người.

Ngữ cảnh và từ đồng âm. Việc chọn đúng từ (“to/too/two”) cần có ngữ cảnh xung quanh và kiến ​​thức chuyên ngành. Hãy sử dụng các mô hình ngôn ngữ mạnh hơn, điều chỉnh chúng cho phù hợp với văn bản chuyên ngành của bạn và xác thực các thực thể quan trọng như tên thuốc hoặc SKU.

Tiếng ồn và kênh âm thanh kémGiao thông, nhiễu xuyên âm, codec cuộc gọi và micro trường xa làm giảm âm thanh quan trọng. Hãy khử nhiễu và chuẩn hóa âm thanh, sử dụng tính năng phát hiện hoạt động giọng nói, mô phỏng tiếng ồn/codec thực tế trong quá trình đào tạo và ưu tiên micro tốt hơn nếu có thể.

Chuyển đổi mã và lời nói đa ngôn ngữ. Mọi người thường trộn lẫn ngôn ngữ hoặc chuyển đổi giữa câu, điều này phá vỡ các mô hình ngôn ngữ đơn lẻ. Hãy chọn các mô hình đa ngôn ngữ hoặc nhận biết chuyển đổi mã, đánh giá dựa trên âm thanh hỗn hợp nhiều ngôn ngữ và duy trì danh sách cụm từ cụ thể theo từng địa phương.

Nhiều loa và chồng chéo. Khi các giọng nói chồng lên nhau, bản ghi sẽ làm mờ phần "ai nói gì". Cho phép ghi âm giọng nói để ghi nhãn lượt nói và sử dụng chức năng tách/định hướng chùm tia nếu có sẵn âm thanh đa micrô.

Tín hiệu video trong bản ghi âmTrong video, chuyển động môi và văn bản trên màn hình bổ sung ý nghĩa mà âm thanh đơn thuần có thể bỏ sót. Khi chất lượng là yếu tố quan trọng, hãy sử dụng các mô hình nghe nhìn và kết hợp ASR với OCR để ghi lại tiêu đề, tên và thuật ngữ trên slide.

Chất lượng chú thích và ghi nhãn. Bản ghi chép không nhất quán, thẻ diễn giả sai hoặc dấu câu cẩu thả sẽ làm giảm hiệu quả đào tạo và đánh giá. Hãy thiết lập một hướng dẫn phong cách rõ ràng, kiểm tra mẫu thường xuyên và giữ một bộ vàng nhỏ để đo lường tính nhất quán của người chú thích.

Quyền riêng tư và tuân thủ. Các cuộc gọi và bản ghi âm lâm sàng có thể chứa PII/PHI, do đó việc lưu trữ và truy cập phải được kiểm soát chặt chẽ. Biên tập hoặc xóa nhận dạng đầu ra, hạn chế quyền truy cập và lựa chọn triển khai đám mây so với tại chỗ/ngoại vi để đáp ứng chính sách của bạn.

Làm thế nào để chọn nhà cung cấp chuyển giọng nói thành văn bản tốt nhất

Chọn nhà cung cấp bằng cách kiểm tra âm thanh (giọng nói, thiết bị, tiếng ồn) và so sánh độ chính xác với quyền riêng tư, độ trễ và chi phí. Bắt đầu từ quy mô nhỏ, đo lường, sau đó mở rộng quy mô.

Xác định nhu cầu trước

  • Các trường hợp sử dụng: phát trực tuyến, hàng loạt hoặc cả hai
  • Ngôn ngữ/giọng nói (bao gồm cả chuyển đổi mã)
  • Kênh âm thanh: điện thoại (8 kHz), ứng dụng/máy tính để bàn, trường xa
  • Quyền riêng tư/nơi cư trú: PII/PHI, khu vực, lưu giữ, kiểm toán
  • Các ràng buộc: mục tiêu độ trễ, SLA, ngân sách, đám mây so với tại chỗ/biên

Đánh giá về âm thanh của bạn

  • Độ chính xác: WER + độ chính xác của thực thể (thuật ngữ chuyên ngành, tên, mã)
  • Nhiều người nói: chất lượng ghi chép (ai nói khi nào)
  • Định dạng: dấu câu, chữ hoa, số/ngày tháng
  • Truyền phát: Độ trễ TTFT/TTF + độ ổn định
  • Các tính năng: danh sách cụm từ, mô hình tùy chỉnh, biên tập, dấu thời gian

Hỏi trong RFP

  • Hiển thị kết quả thô trên bộ thử nghiệm của chúng tôi (theo trọng âm/tiếng ồn)
  • Cung cấp độ trễ phát trực tuyến p50/p95 trên các clip của chúng tôi
  • Độ chính xác của nhật ký cho 2–3 người nói có chồng chéo
  • Xử lý dữ liệu: xử lý trong khu vực, lưu giữ, nhật ký truy cập
  • Đường dẫn từ danh sách cụm từ → mô hình tùy chỉnh (dữ liệu, thời gian, chi phí)

Chú ý cờ đỏ

  • Bản demo tuyệt vời, nhưng kết quả âm thanh lại kém
  • “Chúng tôi sẽ sửa chữa bằng cách tinh chỉnh” nhưng không có kế hoạch/dữ liệu
  • Phí ẩn cho việc ghi nhật ký/biên tập/lưu trữ

[Cũng đọc: Hiểu quy trình thu thập dữ liệu âm thanh để nhận dạng giọng nói tự động]

Tương lai của công nghệ chuyển giọng nói thành văn bản

Các mô hình “nền tảng” đa ngôn ngữ lớn hơn. Mong đợi các mô hình đơn lẻ có thể bao phủ hơn 100 ngôn ngữ với độ chính xác cao hơn mà không cần nhiều tài nguyên, nhờ vào quá trình đào tạo trước quy mô lớn và tinh chỉnh nhẹ.

Nói + dịch trong một lần. Các mô hình hợp nhất sẽ xử lý ASR, dịch giọng nói thành văn bản và thậm chí là chuyển giọng nói thành giọng nói—giảm độ trễ và mã kết dính.

Định dạng và ghi nhật ký thông minh hơn theo mặc định. Dấu câu tự động, cách viết hoa, số và nhãn "ai-nói-khi nào" đáng tin cậy sẽ ngày càng được tích hợp sẵn cho cả chế độ phát trực tuyến và chế độ phát hàng loạt.

Nhận dạng âm thanh-hình ảnh trong môi trường khắc nghiệt. Các tín hiệu môi và văn bản trên màn hình (OCR) sẽ cải thiện bản ghi khi âm thanh bị nhiễu—đây vốn là lĩnh vực nghiên cứu phát triển nhanh và là nguyên mẫu sản phẩm ban đầu.

Đào tạo về quyền riêng tư và trên thiết bị/cạnh. Học tập liên bang và triển khai theo container sẽ giữ dữ liệu cục bộ trong khi vẫn cải thiện các mô hình—điều quan trọng đối với các lĩnh vực được quản lý.

AI có khả năng nhận biết quy định. Mốc thời gian của Đạo luật AI của EU có nghĩa là minh bạch hơn, kiểm soát rủi ro tốt hơn và có tài liệu hướng dẫn tích hợp vào sản phẩm và quy trình mua sắm của STT.

Đánh giá phong phú hơn ngoài WER. Các nhóm sẽ chuẩn hóa về độ chính xác của thực thể, chất lượng nhật ký, độ trễ (TTFT/TTF) và tính công bằng giữa các giọng/thiết bị, không chỉ WER tiêu đề.

Shaip giúp bạn đạt được điều đó như thế nào

Khi những xu hướng này xuất hiện, thành công vẫn phụ thuộc vào dữ liệu của bạn. Shaip cung cấp các tập dữ liệu đa ngôn ngữ giàu giọng, chức năng xóa nhận dạng an toàn PHI và các bộ kiểm tra vàng (WER, thực thể, nhật ký hóa, độ trễ) để so sánh công bằng các nhà cung cấp và điều chỉnh mô hình—vì vậy bạn có thể tự tin áp dụng tương lai của STT. Nói chuyện với các chuyên gia dữ liệu ASR của Shaip để lập kế hoạch cho một thí điểm nhanh.

Bạn thấy bài viết này hay? Hãy theo dõi Shaip trên LinkedIn để nhận thêm thông tin cập nhật.

Xã hội Chia sẻ