
以前教机器人干活,得手把手录几百遍动作,再调参数、打标签、反复微调——像教小孩写字,擦了重写十遍才算入门。现在谷歌甩出Gemini Robotics ER 2,直接让机器人看一眼视频、听一句人话,就能拆解任务、自己排步骤、边干边改。它不依赖预设动作库,也不需要针对每个新任务单独训练;拧灯泡、倒咖啡、绕开椅子走过去……这些动作背后没有硬编码逻辑,全靠模型自己从连续视频流里‘读’出进度、卡点、成败。比如倒水时,它不是靠计时器或压力传感器,而是盯着画面判断“水流变细了→杯沿开始溢出→该停了”,91.3%的帧级定位准确率,误差不到1秒。

更关键的是,它终于不“卡顿”了。老式机器人干完一步得停住、上传图像、等服务器回传指令,再动下一步——活像卡顿的视频通话。ER 2却能一边抬手抓壶,一边用Gemini Live API实时分析摄像头画面,同步推理“接下来是转身还是先避障”,动作和思考在同一个时间轴上跑。测试里,它能在失败后只重试错的那一环,而不是整套流程重启,任务进度分类准确率57.4%,听着不高,但意味着机器人第一次有了“我知道自己干到哪了”的自觉。
这不是给某台机器人定制的“外挂”,而是插拔即用的“高层大脑”。谷歌没造自己的人形机器人,却把ER 2做成API,塞进Apptronik的Apollo、Franka的机械臂,甚至未来波士顿动力的Atlas里。它不绑定硬件,不锁死场景,连扎垃圾袋这种成功率还不高的难题,也被当作待优化项而非不可解命题。安全上也更谨慎:遇到模糊指令或潜在风险动作(比如伸手进运转的传送带),它会主动拒绝执行——不是靠规则列表,而是基于对物理世界因果关系的理解做判断。说白了,它正在把机器人从“听话的工具”,变成“能商量的搭档”。
这种转变背后,其实是AI理解能力的一次跃迁。过去机器人“看”视频,本质是把画面切成帧、逐帧分类——像考驾照科目二时死记点位,车头到哪线停、后视镜看到什么就打方向。ER 2不一样,它用的是端到端的时空建模,把连续动作当“句子”来读:拧灯泡不是“转动手腕+施加扭矩”,而是“手靠近灯座→指尖触到螺纹→旋转角度增大→阻力突然减小→灯亮”。研究人员在《Science Robotics》上公开的实验显示,模型能从17秒的倒咖啡视频里自动切分出6个语义阶段,每个阶段对应真实物理状态变化,比如“壶嘴刚过杯沿”和“水流接触液面”的时间差被识别出来,误差仅0.32秒。
有意思的是,它学得越久,越会“偷懒”。测试中给它重复做10次开抽屉任务,前3次它老老实实拉把手、推门板;到第7次,发现抽屉滑轨有点松动,它开始微调抓取位置,改用指尖卡住侧边缝隙发力——这不是程序写的容错逻辑,而是模型在视频流里自己发现了“松动→异响→滑移轨迹偏移”之间的关联。团队没喂过这类数据,纯靠多任务训练积累的物理直觉。
当然,离真能进厨房还差口气。目前它在光照稳定、背景干净的实验室环境里表现亮眼,但换到反光灶台、毛玻璃柜门或者孩子突然闯入的画面里,任务成功率会掉到68%。谷歌工程师坦率承认:“它现在像刚拿到驾照的新手,能走直线、能倒库,但雨天路滑、旁边有狗窜出来,还得靠人踩一脚。”可正因如此,这套系统把“失败归因”也变成了学习素材——每次卡住,它会自动生成简短原因描述(比如“遮挡导致手部关键点丢失”),同步存进本地缓存,下次遇到类似场景优先调用。不靠大模型瞎猜,而是让机器人自己攒经验本。
最实在的进步藏在细节里:以前调试一个新任务平均要花4.2小时,现在工程师对着手机摄像头拍段操作视频,说句“照这个做”,15分钟内就能部署上线。波士顿动力透露,他们已用ER 2替换了Atlas部分导航模块的硬编码逻辑,让机器人在仓库巡检时第一次能主动绕开临时堆放的纸箱,而不是撞上去再报错重启。工具变伙伴,从来不是靠喊口号,而是当它帮你扶住快倒的扫地机器人,顺手把你掉在地上的耳机塞回口袋——那一刻,你才真正觉得,它懂你在乎什么。
广瑞网提示:文章来自网络,不代表本站观点。