Cách Shaip triển khai chương trình đánh giá chất lượng sao chép giọng nói có khả năng mở rộng cho một khách hàng về trí tuệ nhân tạo xử lý giọng nói.

Từ chất lượng bản demo đến sẵn sàng triển khai — cách thức đánh giá có hệ thống của con người đã giúp một ứng dụng nhận dạng giọng nói bằng AI thu hẹp khoảng cách giữa các chỉ số trong phòng thí nghiệm và hiệu suất thực tế.

Nhân bản giọng nói

Tổng Quan Dự Án

Các mô hình sao chép giọng nói có thể nghe rất ấn tượng trong các bản demo nhưng vẫn gặp khó khăn trong sử dụng thực tế. Khách hàng cần một cách đáng tin cậy để đo lường xem mô hình của họ có thực sự được cải thiện hay không – đặc biệt là đối với tiếng Anh Ấn Độ, một thị trường ưu tiên triển khai.

Shaip được mời đến để thiết kế và quản lý một chương trình đánh giá nhân sự nhằm trả lời ba câu hỏi kinh doanh quan trọng:

  • Bài phát biểu nghe có tự nhiên không?
  • Liệu âm thanh vẫn giống như loa gốc không?
  • Liệu nó có đủ an toàn và đáng tin cậy để sử dụng trong sản xuất không?

Thay vì chỉ dựa vào các chỉ số tự động, dự án đã sử dụng các chuyên gia đánh giá được đào tạo bài bản để đánh giá các sản phẩm âm thanh thực tế và xác định những điểm mà mô hình vẫn còn thiếu sót.

Chất lượng sao chép giọng nói

Các chỉ số chính của tập dữ liệu

Trường hợp sử dụng

Đánh giá chất lượng sao chép giọng nói

Thời lượng dự án

12 tuần

Các mẫu đã được xem xét

12,400 đoạn âm thanh tổng hợp

Người chú thích đã được triển khai

48 chuyên gia đánh giá tiếng Anh được đào tạo

Những thách thức trong việc đánh giá chất lượng chuyển văn bản thành giọng nói và sao chép giọng nói.

  • Mô hình cần phải hoạt động tốt trên nhiều lĩnh vực khác nhau. nhiều giọng tiếng AnhĐặc biệt là tiếng Anh Ấn Độ.
  • Chất lượng âm thanh cần được cải thiện theo những cách có ý nghĩa đối với người dùng cuối, chứ không chỉ đơn thuần là các chỉ số trong phòng thí nghiệm.
  • Nhóm cần một cách rõ ràng để xác định Điều gì đã xảy ra sai trong quá trình phát âm?.
  • Các đoạn ghi âm dài đôi khi bị mất đi danh tính của người nói ban đầu theo thời gian.
  • Khách hàng cũng cần kiểm tra các khoản phí. an toàn, rủi ro mạo danh và sự hiện diện của hình mờ.

Giải pháp: Khung đánh giá của con người đối với chất lượng giọng nói AI

Chiến lược đánh giá

Shaip đã xây dựng một khung đánh giá có cấu trúc để đánh giá tính tự nhiên, rõ ràng, độ tương đồng giọng nói, tính nhất quán và độ an toàn.

Đánh giá thủ công quy mô lớn

48 chuyên gia đánh giá được đào tạo đã xem xét 12,400 mẫu âm thanh thuộc các thể loại tiếng Anh Ấn Độ, tiếng Anh Mỹ chuẩn và một phần phụ về Hinglish (tiếng Anh pha tiếng Ấn Độ và tiếng Anh pha tiếng Anh).

Đánh giá ba phần

  • Các nhà phê bình đã chấm điểm dựa trên mức độ tự nhiên và dễ hiểu của từng đoạn âm thanh.
  • Họ so sánh từng cặp đoạn video để xác định phiên bản nào tốt hơn.
  • Họ đã chỉ ra các vấn đề chất lượng thường xuyên xảy ra như nhịp điệu không tự nhiên, vấn đề về cao độ và hiện tượng lệch âm.

Kiểm tra chất lượng

Shaip đã sử dụng các nhiệm vụ hiệu chuẩn, kiểm tra tiêu chuẩn vàng, đánh giá lặp lại và giám sát chất lượng để đảm bảo tính nhất quán và độ tin cậy của quá trình chấm điểm.

Vòng phản hồi có thể hành động

Kết quả từ mỗi chu kỳ sprint đều được đưa trở lại quy trình tinh chỉnh của khách hàng, giúp mô hình được cải thiện qua nhiều vòng.

Phạm vi dự án: Ngôn ngữ, giọng điệu và phạm vi ôn tập

Area Phạm vi
Ngôn ngữ Tiếng Anh
Điểm nhấn ưu tiên Tiếng Anh Ấn Độ, Tiếng Anh Mỹ trung lập
Bảo hiểm thứ cấp Tiếng Anh Anh, nhánh phụ Hinglish
Các loại mẫu Các đoạn video tham khảo ngắn, các mẫu cảnh quay ngắn, bài phát biểu dài.
Xem lại đầu ra Xếp hạng chất lượng, nhãn ưu tiên, gắn thẻ vấn đề
Độ dài tương tác 12 tuần

Kết quả: Cải thiện rõ rệt trong việc sao chép giọng nói

  • Chất lượng âm thanh được cải thiện rõ rệt: Điểm chất lượng tổng thể của mô hình đã được cải thiện từ 3.41 lên 4.12, cho thấy giọng nói trở nên tự nhiên hơn và sẵn sàng cho việc sản xuất.
  • Phối hợp loa tốt hơn: Hệ thống đã cải thiện đáng kể khả năng giữ nguyên giọng nói gốc của người nói, nâng cao độ tương đồng từ 0.71 lên 0.87.
  • Ít lỗi dễ nhận thấy hơn: Các vấn đề về phát âm đã giảm từ 31% số mẫu ở giai đoạn ban đầu xuống còn 11% vào giai đoạn cuối cùng.
  • Khả năng hiểu rõ cao: Tỷ lệ lỗi từ cuối cùng đối với tiếng Anh Ấn Độ đạt 4.8%, vượt qua ngưỡng mục tiêu.
  • Sự sẵn sàng triển khai an toàn hơn: Đánh giá cũng xác nhận hiệu suất mạnh mẽ trong các khâu kiểm tra an toàn quan trọng, bao gồm sàng lọc rủi ro mạo danh và xác minh hình mờ.
Quan trọng nhất, khách hàng đã có được một hệ thống đánh giá có thể lặp lại, không chỉ để đánh giá chất lượng mô hình mà còn để liên tục cải thiện nó. Chương trình ban đầu chỉ là một chương trình đánh giá kỹ thuật, nhưng sau đó đã trở thành một công cụ ra quyết định thiết thực cho các nhóm sản phẩm, nhóm mô hình và các bên liên quan đến triển khai.
Biểu tượng trích dẫn

Shaip đã giúp chúng tôi biến chất lượng âm thanh chủ quan thành một chương trình cải thiện có thể đo lường được. Khung đánh giá của họ đã cung cấp cho chúng tôi những tín hiệu rõ ràng về những gì cần sửa, những gì cần cải thiện và làm thế nào để tiến gần hơn đến giai đoạn sản xuất một cách tự tin.

— Trưởng nhóm sản phẩm AI Speech

★ ★ ★ ★ ★
Biểu tượng trích dẫn