Dữ liệu huấn luyện AI vật lý

Dữ liệu huấn luyện AI vật lý: Lớp còn thiếu giữa thị giác và hành động

Một mô hình quen thuộc đã xuất hiện trong lĩnh vực robot và hệ thống tự hành: một bản demo hàng đầu hoạt động hoàn hảo trên sân khấu, nhưng hệ thống tương tự lại gặp trục trặc trong một nhà kho thực tế hai tuần sau đó, và phân tích sau sự cố đổ lỗi cho "thực tế" phức tạp hơn môi trường thử nghiệm. Một số ý kiến ​​trong lĩnh vực này cho rằng yếu tố còn thiếu chính là phần cứng — các bộ kẹp tốt hơn, cảm biến lực-mô-men xoắn, lớp phủ xúc giác. Lập luận đó đúng, nhưng chưa đầy đủ. Ngay cả phần cứng cảm biến lý tưởng cũng tạo ra các luồng tín hiệu thô mà mô hình phải xử lý. kiến thức Để giải thích. Nút thắt cổ chai thực sự đằng sau hầu hết các thất bại của Trí tuệ Nhân tạo Vật lý không phải là cảm biến. Mà là tính đa phương thức. Dữ liệu huấn luyện AI vật lý Điều đó giúp các mô hình hiểu được ý nghĩa của những tín hiệu đó, mối tương quan giữa chúng với thị giác và những hành động cần thực hiện khi thế giới phản hồi. Dữ liệu đó hầu như không tồn tại ở quy mô công nghiệp — và đó chính là lớp dữ liệu còn thiếu.

“Lớp còn thiếu” trong Trí tuệ nhân tạo vật lý thực chất là gì?

Vòng lặp Trí tuệ Nhân tạo Vật lý quen thuộc — cảm nhận, quyết định, hành động, thích nghi — thường được thảo luận như thể đó là một vấn đề về phần cứng và kiến ​​trúc. Trên thực tế, mỗi mũi tên trong vòng lặp đó là một hành vi được học hỏi. ý nghĩa có nghĩa là một mô hình chuyển đổi các luồng dữ liệu cảm biến nhiễu, đa chiều thành các ước tính trạng thái có thể hành động được. Quyết định Điều này có nghĩa là một chính sách đã trải qua đủ nhiều biến thể để có thể khái quát hóa. Hành động Điều này có nghĩa là khả năng kiểm soát được học hỏi dựa trên động lực thực tế. Phỏng theo Điều đó có nghĩa là nhận biết, chỉ trong vài mili giây, rằng một điểm bám đang bị trượt hoặc một bộ phận bị lệch – và tự động điều chỉnh ngay trong quá trình chuyển động. Không hành vi nào trong số đó có thể được lập trình sẵn. Chúng được học từ các ví dụ. Khi một hệ thống Trí tuệ Nhân tạo Vật lý không thể thích nghi trong quá trình tiếp xúc, nguyên nhân gốc rễ thường là do dữ liệu huấn luyện của nó không bao gồm đủ các ví dụ được gắn nhãn về tiếp xúc để học hỏi. Phần cứng có thể truyền tải các tín hiệu chính xác. Mô hình vẫn cần tập dữ liệu giúp cho những tín hiệu đó có ý nghĩa.

Vì sao bộ dữ liệu chỉ chứa hình ảnh lại phá vỡ trí tuệ nhân tạo vật lý

Bộ dữ liệu chỉ dựa trên hình ảnh phá vỡ trí tuệ nhân tạo vật lýHãy tưởng tượng một nhà điều hành kho vận tầm trung triển khai một robot chọn hàng tự động tại ba trung tâm phân phối. Mô hình thị giác của robot được huấn luyện trên hàng triệu hình ảnh sản phẩm. Nó nhận diện các mặt hàng ngay lập tức. Tuần đầu tiên triển khai thực tế, hiệu suất có vẻ tốt. Đến tuần thứ ba, năng suất giảm đi một phần ba. Các mặt hàng mà robot gặp khó khăn không phải là những mặt hàng khó tìm. xemChúng rất khó xử lý: những thùng carton bị bẹp một nửa biến dạng khi tiếp xúc, những bó hàng được bọc màng co dễ bị trượt, và những hộp nhựa phản quang hình vỏ sò gây nhầm lẫn trong việc ước lượng độ sâu khi kết hợp với ánh sáng từ trên cao. Dữ liệu thị giác cho mô hình biết các vật thể trông như thế nào. Không có gì trong tập dữ liệu huấn luyện cho mô hình biết chúng có cảm giác ra sao, phản ứng như thế nào với lực tác động, hoặc khi nào lực nắm sắp bị đứt.

Đây là lỗ hổng cấu trúc trong hầu hết các hệ thống Trí tuệ Nhân tạo Vật lý — và nó xuất hiện trong các tập dữ liệu trước khi xuất hiện trên dây chuyền sản xuất.

kích thước Bộ dữ liệu chỉ dành cho thị giác Bộ dữ liệu huấn luyện Trí tuệ nhân tạo vật lý đa phương thức
Phương thức Ảnh RGB, thỉnh thoảng có độ sâu Thị giác, chiều sâu, xúc giác, lực/mô-men xoắn, cảm thụ bản thể, thính giác
Nguồn chụp Hình ảnh được thu thập hoặc dàn dựng Thu thập thông tin có chủ đích từ các tương tác thực tế hoặc điều khiển từ xa.
Loại chú thích Hộp giới hạn, phân đoạn, lớp Các sự kiện tiếp xúc, độ trượt, chất lượng cầm nắm, hồ sơ lực, sự căn chỉnh theo thời gian
lợi thế quy mô Dễ sao chép và có giá thành rẻ. Đắt đỏ — mỗi mẫu thử đều cần phải được lấy trực tiếp.
sự phù hợp nhiệm vụ hạ lưu Nhận thức, định hướng Thao túng, thích nghi, kiểm soát thông qua tiếp xúc trực tiếp

Các nghiên cứu đánh giá ngang hàng về khả năng thao tác đã chỉ ra rằng việc bổ sung dữ liệu xúc giác vào các quy trình huấn luyện chỉ dựa trên thị giác có thể nâng cao tỷ lệ thành công thao tác lên khoảng 20 điểm phần trăm, và còn có thêm một sự cải thiện đáng kể nữa nhờ huấn luyện trước kết hợp thị giác và xúc giác (Nguồn: Kết quả đánh giá chuẩn IEEE/RSJ IROS, 2024). Sự khác biệt không chỉ là nhỏ. Đó là ranh giới giữa bản demo và bản triển khai thực tế.

Bốn lớp của một tập dữ liệu huấn luyện AI vật lý thực tế

Việc xây dựng một tập dữ liệu thực sự dạy cho mô hình hoạt động trong thế giới vật lý đòi hỏi bốn lớp liên kết chặt chẽ. Bỏ qua bất kỳ lớp nào trong số đó, toàn bộ hệ thống phía trên sẽ sụp đổ.

Bốn lớp của một tập dữ liệu huấn luyện trí tuệ nhân tạo vật lý thực tế

  1. Thu thập dữ liệu đa phương thức. Bộ dữ liệu phải chứa những gì robot thực sự sẽ trải nghiệm: video RGB và độ sâu được đồng bộ hóa, LiDAR hoặc ảnh nổi (nếu có), tín hiệu xúc giác (phân bố áp suất, độ rung, độ trượt), các chỉ số lực và mô-men xoắn tại điểm tiếp xúc, dữ liệu cảm thụ về trạng thái kẹp, và thường cả âm thanh. Hệ thống thu thập dữ liệu cũng quan trọng không kém gì các cảm biến — vị trí đặt, hiệu chuẩn và khả năng thu thập dữ liệu ở những trường hợp ngoại lệ quan trọng nhất. Các nhóm tự xây dựng hệ thống này thường kết hợp đội ngũ robot nội bộ với một chuyên gia. Thu thập dữ liệu AI vật lý Hợp tác để đáp ứng sự đa dạng, phạm vi địa lý và các kịch bản khác nhau mà một bộ dữ liệu mạnh mẽ cần có.
  2. Đồng bộ hóa thời gian và tích hợp dữ liệu cảm biến. Một xung xúc giác ở tần số 1,500 Hz sẽ vô nghĩa nếu không biết luồng hình ảnh và cảm biến lực đang hiển thị gì trong cùng một mili giây. Sự đồng bộ về thời gian giữa các phương thức là điều cho phép mô hình học được, ví dụ, rằng một tín hiệu hình ảnh cụ thể dự đoán sự kiện trượt 40 mili giây trước khi áp lực xúc giác giảm. Nếu không có sự đồng bộ, bạn sẽ có các luồng song song thay vì dữ liệu huấn luyện.
  3. Chú thích chi tiết về thông tin liên hệ. Đây là lớp khó nhất và là lớp mà hầu hết các chương trình đều đánh giá thấp. Người chú thích cần phải gắn nhãn chất lượng kẹp, thời điểm trượt, thời điểm bắt đầu và kết thúc tiếp xúc, tư thế vật thể bên trong bộ kẹp, biến dạng dưới tác dụng lực và ranh giới thời gian của các hành động phụ. Để làm đúng điều này cần có các nhóm chú thích được đào tạo, quy trình xem xét nhiều cấp độ và các hướng dẫn nhất quán trên các phương thức khác nhau — đó là lý do tại sao hầu hết các hoạt động nghiêm túc đều dựa vào một hệ thống chú thích đa cấp. quy trình chú thích dữ liệu có cấu trúc thay vì cố gắng mở rộng quy mô một cách tùy tiện.
  4. Phản hồi vận hành liên tục. Một khi hệ thống Trí tuệ Nhân tạo Vật lý được triển khai, mỗi lần chọn thành công, suýt chọn và thất bại đều trở thành dữ liệu mới. Các nhóm hoàn thiện chu trình — thu thập, gắn nhãn, huấn luyện lại, triển khai lại — sẽ thấy được lợi ích tích lũy. Các nhóm không làm như vậy sẽ chứng kiến ​​mô hình của họ âm thầm thay đổi khi thế giới xung quanh biến đổi.

Vì sao chú thích vật lý bằng AI lại là một lĩnh vực khác biệt

Chú thích vật lý bằng AI là một lĩnh vực khác.Việc chú thích dữ liệu huấn luyện Trí tuệ Nhân tạo Vật lý không chỉ đơn thuần là gắn nhãn hình ảnh với các bước bổ sung. Đó là một lĩnh vực khác. Hãy nghĩ về nó như việc đào tạo một đầu bếp học việc so với việc cho họ xem video dạy nấu ăn. Video dạy về nhận dạng — Đó là kiểu thái julienne, còn đây là kiểu thái brunoise.Một khóa học nghề dạy người học cảm nhận thế nào là dao sắc khi cắt củ hành tây cứng, khi nào chảo đủ nóng mà không cần kiểm tra nhiệt kế, và cách điều chỉnh tư thế cầm khi cán dao bị trơn. Loại hình học tập thứ hai cần có người hướng dẫn bên cạnh người học nghề, ghi lại trải nghiệm từng khoảnh khắc. Chú thích vật lý bằng AI hoạt động theo cách tương tự: người chú thích không chỉ đánh dấu những gì có thể nhìn thấy; họ còn ghi nhãn các sự kiện tiếp xúc, cấu hình lực, thời điểm bắt đầu trượt và ranh giới thời gian của các hành động trên các luồng cảm biến được đồng bộ hóa. Điều này đòi hỏi người chú thích am hiểu lĩnh vực, kiểm soát chất lượng mạnh mẽ và các công cụ chuyên dụng. Nếu được thực hiện tốt, nó sẽ biến dữ liệu đa phương thức thô thành loại dữ liệu... dữ liệu huấn luyện robot Việc này thực chất dạy cho mô hình cách xử lý tiếp xúc. Nếu làm không tốt, nó sẽ tạo ra nhiễu có nhãn.

Kết luận — Phần cứng hoàn thiện chu trình; dữ liệu khởi đầu chu trình.

Các bộ kẹp tốt hơn, lớp phủ xúc giác và cảm biến lực là những tiến bộ thực sự. Tuy nhiên, không cái nào trong số chúng loại bỏ được nhu cầu về các tập dữ liệu đa phương thức, đồng bộ, được chú thích đầy đủ để dạy mô hình hiểu ý nghĩa của các tín hiệu đó trong ngữ cảnh. Các tổ chức thu hẹp khoảng cách giữa các bản demo Trí tuệ Nhân tạo Vật lý và việc triển khai Trí tuệ Nhân tạo Vật lý là những tổ chức coi dữ liệu là cơ sở hạ tầng hạng nhất — thu thập dữ liệu một cách có chủ đích, chú thích dữ liệu với độ chính xác cao và đưa dữ liệu hoạt động trở lại quá trình huấn luyện như một vòng lặp liên tục. Phần cứng hoàn thiện vòng lặp cảm nhận-quyết định-hành động-thích nghi. Dữ liệu huấn luyện là thứ khởi đầu vòng lặp đó.

Nó là dữ liệu đa phương thức, đồng bộ hóa thời gian và được thu thập từ các tương tác vật lý thực tế hoặc điều khiển từ xa. Dữ liệu huấn luyện AI thông thường thường là văn bản hoặc hình ảnh được thu thập hàng loạt. Dữ liệu huấn luyện AI vật lý phải bao gồm các luồng dữ liệu cảm biến — thị giác, chiều sâu, xúc giác, lực, cảm thụ bản thể — được ghi lại trong quá trình tiếp xúc thực tế với các vật thể và môi trường.

Camera có thể cho robot biết vật thể trông như thế nào, nhưng không thể cho biết vật thể phản ứng ra sao với lực tác động, liệu khớp nối có bị trượt hay không, hoặc vật liệu biến dạng như thế nào dưới áp lực. Thao tác là một vấn đề về tiếp xúc. Nếu thiếu dữ liệu về xúc giác và lực trong tập dữ liệu huấn luyện, mô hình sẽ không có cơ sở để thích nghi trong quá trình tiếp xúc.

Khác với hình ảnh trên internet, mỗi điểm dữ liệu xúc giác đều yêu cầu sự tương tác vật lý — robot hoặc con người thực sự chạm, nắm hoặc xử lý vật thể. Điều đó khiến quá trình thu thập dữ liệu chậm, tốn kém và nhạy cảm với việc hiệu chỉnh thiết bị, do đó các bộ dữ liệu công khai quy mô lớn vẫn còn hiếm.

Mô phỏng rất có giá trị, đặc biệt đối với các tình huống hiếm gặp hoặc nguy hiểm, nhưng vẫn còn những khác biệt đáng kể giữa mô phỏng và thực tế đối với động lực tiếp xúc, độ đàn hồi vật liệu và nhiễu cảm biến. Các quy trình huấn luyện Trí tuệ Nhân tạo Vật lý mạnh mẽ nhất kết hợp dữ liệu tổng hợp và dữ liệu thực tế thay vì chỉ dựa vào một trong hai.

Có hai hướng tiếp cận. Thứ nhất, xác định những lỗi sản xuất nào do tiếp xúc gây ra — trượt, biến dạng, sai lệch — vì đó là những lỗi mà chỉ dữ liệu mới có thể khắc phục được. Thứ hai, lập kế hoạch chương trình thu thập dữ liệu có mục tiêu, bổ sung các phương thức cảm nhận còn thiếu (xúc giác, lực, cảm thụ bản thể) vào các nhiệm vụ cụ thể mà nó sẽ tạo ra sự khác biệt, thay vì cố gắng xây dựng lại toàn bộ tập dữ liệu cùng một lúc.

Bạn thấy bài viết này hay? Hãy theo dõi Shaip trên LinkedIn để nhận thêm thông tin cập nhật.

Xã hội Chia sẻ