Google DeepMind phát hành ba model Gemini Robotics 2 đưa robot vượt khỏi thao tác trên mặt bàn sang điều khiển toàn thân, khéo léo năm ngón và phối hợp nhiều robot cùng lúc. Trong thử nghiệm, hệ thống tháo được bóng đèn thành công 92% số lần.
💡 Vì sao đáng chú ý: đây là lần đầu một hãng lab lớn gộp vision, language và action thành một stack chạy được trên nhiều loại thân robot khác nhau — bước chuyển từ demo sang thứ có thể triển khai.
- Ba model: Gemini Robotics 2, Robotics ER 2 và bản on-device.
- ER 2 lo phần lập kế hoạch nhiều bước và điều phối nhiều robot.
- Tháo bóng đèn thành công 92% — chỉ số khéo léo hiếm khi được công bố.
- Kèm ASIMOV-Agentic: benchmark đo an toàn khi nhiều AI cùng điều khiển robot.
- Đầu vào là camera cộng lệnh ngôn ngữ tự nhiên, đầu ra là lệnh động cơ.
Điểm mới thật sự không nằm ở chuyện robot xếp kệ hay buộc túi. Nó nằm ở chỗ DeepMind tách phần suy luận (ER 2) ra khỏi phần điều khiển, rồi để ER 2 điều phối nhiều robot cùng làm một mục tiêu. Đó là kiến trúc orchestrator - worker quen thuộc trong thế giới phần mềm, giờ áp lên phần cứng. Với doanh nghiệp sản xuất ở Việt Nam, đừng vội nghĩ đến việc mua robot hình người — cái đáng theo dõi là chuẩn giao tiếp: khi một model điều khiển được nhiều loại thân robot, chi phí tích hợp giảm mạnh, và các nhà tích hợp nội địa sẽ có cửa. Con số 92% nghe cao nhưng trong sản xuất thì 8% lỗi là không chấp nhận được, nên đây vẫn là giai đoạn thử nghiệm. Việc DeepMind tung kèm benchmark an toàn ASIMOV-Agentic cho thấy chính họ cũng biết rủi ro nằm ở chỗ nhiều agent phối hợp chứ không phải một agent đơn lẻ. Cái phải nhớ: 2026 là năm AI rời khỏi màn hình, và ai chuẩn bị dữ liệu vận hành từ bây giờ sẽ đỡ vất vả về sau.