先说结论:进步在“同一个智能层统筹身体”,不是机器人已经能稳定包办家务
Gemini Robotics 2 把三个过去常被分开演示的问题放到一起。ER 2 看图、听懂要求、把几分钟任务拆成步骤并与人沟通;Robotics 2 把语言和视觉计划转成全身、双臂、手指或夹爪动作;On-Device 2 则为断网、低延迟场景提供本地 VLA。官方展示 Apollo 2 走到桌前拿起物体、弯腰放进低层架,也展示两台不同机器人分工整理房间,以及同一 checkpoint 控制不同手和夹爪。
对内容创作者最重要的不是重复视频,而是把成功率放回画面。Google 的图表显示,标准双指夹爪在部分拣选、装配任务上达到中高成功率;五指手的波动明显更大,扫帚簸箕只有 32%,拧灯泡 36%,扎垃圾袋 44%,封 Ziplock 40%,旋出灯泡则有 92%。这说明“能做过”与“每次都能做”是两回事,绳结、柔性袋和接触丰富的动作仍是难点。官方也承认移动速度与人类级精细操作还需提高。
“本地运行”和“安全评测”都不能省略系统边界
On-Device 2 的亮点是跨机体适配。官方称对新的双臂机器人,通常用少于 200 个示例、数小时数据即可适配;这比从头收集大规模演示更有吸引力,但仍是公司在选定平台与任务上的口径。传感器标定、控制频率、末端执行器、碰撞模型、算力、中文指令和故障恢复都会改变结果。除非有独立团队在公开协议下复现,不能把它推广成“任何机器人半天学会家务”。
安全报告反而给了最值得写的边界。它强调急停、围栏、速度/力限制等传统保护仍不可少,并明确没有评估认证硬件、冗余和实时系统保证。在人体接近测试里,降低漏停会带来更多误停,降低误停又可能漏掉真正危险,没有模型进入两者都接近零的理想区。实验室的 99% 人体检测和 96% 安全姿态切换可以说明进展,却不能代替完整风险评估。好的中文报道应把智能规划、动作能力与合规安全分成三层,既不否认突破,也不把精剪演示提前写成消费级家用产品。