VPP2 làm được gì
Mô hình hành động thế giới hướng tới trao cho robot một dạng trí tưởng tượng: khả năng dự đoán điều sẽ xảy ra sau một hành động và chọn chuyển động phù hợp. Khác với các mô hình tạo video vốn được thiết kế để sản xuất nội dung hình ảnh, VPP2 được huấn luyện để hiểu cách vật thể chuyển động và làm theo các chỉ dẫn thao tác chính xác, kết nối những gì robot nhìn thấy với những gì nó làm.
Với các nhiệm vụ phức tạp gồm nhiều bước, mô hình có thể phối hợp với một mô hình thị giác – ngôn ngữ để chia chỉ dẫn cấp cao thành các bước nhỏ có thể thực hiện. ROBOTERA đã công bố mã nguồn trên GitHub, cho phép giới nghiên cứu toàn cầu thử nghiệm và phát triển tiếp, động thái có thể đẩy nhanh tiến bộ và mở ra sự kiểm chứng với các tuyên bố của công ty.
Kết quả trên nhiều bộ tiêu chuẩn
Ngoài vị trí trên RoboDojo, ROBOTERA cho biết VPP2 đạt tỷ lệ thành công trung bình 58,5% trên 10 nhóm nhiệm vụ của nền tảng robot ALOHA, vượt các mô hình đối chứng hàng đầu ở chín nhóm, và đạt 45,0% trên LIBERO-Pro, bài kiểm tra về thao tác và khả năng khái quát. Theo công ty, khi bổ sung lập kế hoạch nhiệm vụ cấp cao, tỷ lệ thành công trên năm nhóm nhiệm vụ tăng từ 27,6% lên 57,6%.















