Công nhân đám đông để thu thập dữ liệu

Công nhân đám đông để thu thập dữ liệu – một phần không thể thiếu của đạo đức AI

Trong nỗ lực xây dựng các giải pháp AI mạnh mẽ và khách quan, điều quan trọng là chúng ta phải tập trung vào việc huấn luyện các mô hình trên một tập dữ liệu khách quan, năng động và mang tính đại diện. Quá trình thu thập dữ liệu của chúng ta vô cùng quan trọng trong việc phát triển các giải pháp AI đáng tin cậy. Về vấn đề này, việc thu thập dữ liệu huấn luyện AI thông qua cộng đồng người lao động trở thành một khía cạnh quan trọng của chiến lược thu thập dữ liệu.

Trong bài viết này, chúng ta hãy cùng khám phá vai trò của người lao động cộng đồng, tác động của họ đến việc phát triển các thuật toán học máy và mô hình ML, cũng như sự cần thiết và lợi ích mà họ mang lại cho toàn bộ quá trình.

Tại sao cần có công nhân đám đông để xây dựng các mô hình AI?

Là con người, chúng ta tạo ra vô số dữ liệu, nhưng chỉ một phần nhỏ trong số dữ liệu được tạo ra và thu thập này là có giá trị. Do thiếu các tiêu chuẩn đánh giá dữ liệu, hầu hết dữ liệu thu thập được đều bị sai lệch, chứa nhiều vấn đề về chất lượng hoặc không đại diện cho môi trường. Vì ngày càng có nhiều mô hình học máy và học sâu được phát triển dựa trên lượng dữ liệu khổng lồ, nên nhu cầu về các bộ dữ liệu tốt hơn, mới hơn và đa dạng hơn ngày càng trở nên cấp thiết.

Đó là nơi công nhân đám đông phát huy tác dụng.

Crowd-sourcing data đang xây dựng một bộ dữ liệu với sự tham gia của nhiều nhóm người. Công nhân đám đông truyền trí thông minh của con người vào trí tuệ nhân tạo.

Các nền tảng huy động cộng đồng cung cấp các nhiệm vụ nhỏ về thu thập và chú thích dữ liệu cho một nhóm lớn và đa dạng người dùng. Huy động cộng đồng cho phép các công ty tiếp cận một lực lượng lao động khổng lồ, năng động, tiết kiệm chi phí và có khả năng mở rộng.

Nền tảng huy động cộng đồng phổ biến nhất – Amazon Mechanical Turk, đã thu thập được 11 cuộc hội thoại giữa người với người trong vòng 15 giờ, và trả cho người lao động 0.35 đô la cho mỗi cuộc hội thoại thành công. Việc người lao động được trả thù lao ít ỏi như vậy cho thấy tầm quan trọng của việc xây dựng các tiêu chuẩn thu thập dữ liệu có đạo đức.

Về mặt lý thuyết, đây có vẻ là một kế hoạch thông minh, tuy nhiên, nó không phải là một chiến lược dễ thực hiện. Tính ẩn danh của đám đông công nhân đã làm nảy sinh các vấn đề về lương thấp, coi thường quyền của người lao động và chất lượng công việc kém ảnh hưởng đến hiệu suất của mô hình AI. 

Lợi ích của việc có nhân viên đám đông để lấy dữ liệu

Bằng cách thu hút một nhóm công nhân đám đông đa dạng, các nhà phát triển giải pháp dựa trên AI có thể phân phối các nhiệm vụ vi mô và thu thập các quan sát đa dạng và phổ biến một cách nhanh chóng với chi phí tương đối thấp.

Một số lợi ích nổi bật của việc sử dụng nhân viên đám đông cho các dự án AI là

Lợi ích thu thập dữ liệu thông qua nhân viên đám đông

Rút ngắn thời gian đưa sản phẩm ra thị trường: Theo nghiên cứu của Cognilytica, gần 80% thời gian của dự án trí tuệ nhân tạo được dành cho các hoạt động thu thập dữ liệu như làm sạch dữ liệu, gắn nhãn và tổng hợp dữ liệu. Chỉ có 20% thời gian được dành cho phát triển và đào tạo. Các rào cản truyền thống trong việc tạo ra dữ liệu được loại bỏ vì một số lượng lớn người đóng góp có thể được tuyển dụng trong thời gian ngắn.

Giải pháp tiết kiệm chi phí: Thu thập dữ liệu thông qua cộng đồng giúp giảm thời gian và công sức dành cho việc đào tạo, tuyển dụng và đưa người dùng vào làm việc. Điều này giúp loại bỏ chi phí, thời gian và nguồn lực cần thiết vì lực lượng lao động được trả lương theo từng nhiệm vụ.

Tăng cường tính đa dạng trong tập dữ liệu: Tính đa dạng của dữ liệu rất quan trọng đối với toàn bộ quá trình huấn luyện giải pháp AI. Để một mô hình tạo ra kết quả không thiên vị, nó phải được huấn luyện trên một tập dữ liệu đa dạng. Với việc thu thập dữ liệu từ cộng đồng, có thể tạo ra các tập dữ liệu đa dạng (về địa lý, ngôn ngữ, phương ngữ) với ít nỗ lực và chi phí.

Tăng cường khả năng mở rộng: Khi tuyển dụng được những người làm việc cộng tác đáng tin cậy, bạn có thể đảm bảo thu thập dữ liệu chất lượng cao và có thể mở rộng quy mô dựa trên nhu cầu dự án của mình.

Nội bộ so với nguồn cung ứng cộng đồng – Ai là người chiến thắng?

Dữ liệu nội bộDữ liệu nguồn cộng đồng
Độ chính xác và tính nhất quán của dữ liệu có thể được đảm bảo.Chất lượng, độ chính xác và tính nhất quán của dữ liệu có thể được duy trì nếu các nền tảng tìm nguồn cung ứng đám đông đáng tin cậy với các biện pháp QA tiêu chuẩn được tham gia
Tìm nguồn dữ liệu nội bộ không phải lúc nào cũng là một quyết định thiết thực vì nhóm nội bộ của bạn có thể không đáp ứng được nhu cầu của dự án.Sự đa dạng dữ liệu có thể được đảm bảo vì có thể tuyển dụng một nhóm công nhân đám đông không đồng nhất dựa trên nhu cầu của dự án.
Đắt tiền để tuyển dụng và đào tạo công nhân cho nhu cầu của dự án.Giải pháp tiết kiệm chi phí để thu thập dữ liệu vì có thể tuyển dụng, đào tạo và đưa công nhân lên tàu với mức đầu tư ít hơn.
Thời gian đưa sản phẩm ra thị trường cao do việc thu thập dữ liệu nội bộ mất nhiều thời gian.Thời gian đưa ra thị trường ít hơn đáng kể vì nhiều đóng góp đến nhanh chóng.
Một nhóm nhỏ những người đóng góp nội bộ và người dán nhãnMột nhóm lớn và đa dạng của những người đóng góp và nhãn dữ liệu
Tính bảo mật dữ liệu rất cao với đội ngũ nội bộ.Khó duy trì tính bảo mật dữ liệu khi làm việc với số lượng lớn nhân viên trên toàn thế giới.
Dễ dàng theo dõi, đào tạo và đánh giá người thu thập dữ liệu hơnThách thức để theo dõi và đào tạo những người thu thập dữ liệu.

Thu hẹp khoảng cách giữa nhân viên nguồn cộng đồng và người yêu cầu.

Thu hẹp khoảng cách giữa nhân viên nguồn lực cộng đồng và người yêu cầu Có một nhu cầu cấp thiết để thu hẹp khoảng cách giữa những người làm việc theo đám đông và những người yêu cầu, không chỉ trong lĩnh vực trả lương.

Rõ ràng là người yêu cầu thiếu thông tin trầm trọng vì người lao động chỉ được cung cấp thông tin liên quan đến nhiệm vụ cụ thể. Ví dụ, mặc dù người lao động được giao các nhiệm vụ nhỏ như ghi âm hội thoại bằng tiếng mẹ đẻ của họ, nhưng họ hiếm khi được cung cấp ngữ cảnh. Họ không có thông tin cần thiết về lý do tại sao họ phải làm điều đó và cách tốt nhất để thực hiện. Sự thiếu thông tin này ảnh hưởng đến chất lượng công việc được thực hiện bởi cộng đồng.

Đối với một con người, có toàn bộ bối cảnh mang lại sự rõ ràng và mục đích cho công việc của họ.

Thêm vào hỗn hợp này một khía cạnh khác của NDA – các thỏa thuận không tiết lộ giới hạn lượng thông tin mà một nhân viên đám đông được cung cấp. Từ góc độ nhân viên đám đông, việc rút lại thông tin này cho thấy sự thiếu tin tưởng và giảm tầm quan trọng đối với công việc của họ.

Khi nhìn nhận tình huống tương tự từ phía đối diện, ta thấy sự thiếu minh bạch từ phía người lao động. Người yêu cầu không hiểu rõ về người lao động được giao nhiệm vụ. Một số dự án có thể yêu cầu một loại lao động cụ thể; tuy nhiên, trong hầu hết các dự án, sự không rõ ràng là điều này. Thực tế là điều này có thể làm phức tạp việc đánh giá, phản hồi và đào tạo về sau.

Để giải quyết những khó khăn này, làm việc với các chuyên gia thu thập dữ liệu có thành tích cung cấp dữ liệu đa dạng, được tuyển chọn và trình bày tốt từ nhiều lựa chọn cộng tác viên là rất quan trọng.

Chọn Shaip làm đối tác dữ liệu của bạn có thể có nhiều lợi ích. Chúng tôi tập trung vào sự đa dạng và phân phối đại diện của dữ liệu. Đội ngũ nhân viên tận tâm và giàu kinh nghiệm của chúng tôi hiểu được sự bắt buộc của từng dự án và phát triển các bộ dữ liệu có thể đào tạo các giải pháp mạnh mẽ dựa trên AI ngay lập tức.

[Xem thêm: Hướng dẫn cơ bản về dữ liệu huấn luyện AI: Định nghĩa, ví dụ, bộ dữ liệu ]

Bạn thấy bài viết này hay? Hãy theo dõi Shaip trên LinkedIn để nhận thêm thông tin cập nhật.

Xã hội Chia sẻ