谷歌DeepMind发布新一代机器人AI模型,推动机器人向更智能灵巧方向迈进

   发布时间:2026-07-31 15:31 作者:顾青青

谷歌DeepMind近日宣布推出一款专为人形机器人设计的人工智能系统——Gemini Robotics 2,该系统可实现全身动作协调控制,标志着机器人技术向更复杂的物理交互迈出关键一步。与以往仅控制上半身动作的模型不同,新系统能够同步管理机器人全身的电机,使其在执行任务时完成行走、下蹲、抓取物体等连贯动作,并通过推理能力自主规划路径。

在演示视频中,DeepMind展示了该系统操控Apptronik公司的人形机器人Apollo完成复杂任务的能力:机器人穿越房间、避开障碍物、拿起洒水壶并精准放置到架子上。这一过程无需人工干预,仅依靠摄像头画面和自然语言指令即可完成。研究人员透露,系统在“拧下灯泡”等任务中成功率达92%,但在扎垃圾袋、密封Ziplock袋等精细操作中仍需优化。

此次发布还包含另一款核心模型Gemini Robotics ER 2,其定位为机器人的“推理中枢”。该模型负责分解多步骤任务,例如协调多个机器人共同完成搬运或组装任务,并在执行过程中动态调整策略。谷歌强调,ER 2在安全性能上显著提升,能够识别潜在风险并拒绝执行危险指令,成为公司迄今最安全的机器人模型。

技术开放方面,谷歌采取差异化策略:Gemini Robotics ER 2将通过AI Studio开发者平台和企业级AI平台提供预览;而更专业的Gemini Robotics 2和On-Device 2模型则优先向早期合作伙伴及100余家受信任测试机构开放。同时,公司已启动模型候补名单申请,并与Apptronik、Agile Robots SE、Boston Dynamics等企业展开深度合作。

DeepMind机器人业务副总裁Carolina Parada表示,团队的目标是构建一个通用的智能层,使不同机器人能够共享同一套AI系统。然而,业务总监Kanishka Rao也指出,当前机器人仍存在明显局限:动作迟缓且谨慎,需频繁停顿以处理人类凭直觉完成的决策;学习效率远低于人类,需经历大量试错才能优化行为。

此次发布可视为谷歌机器人战略的重启。此前,Alphabet曾收购多家机器人初创公司,但于2023年关闭Everyday Robots部门。新系统基于2025年推出的Gemini Robotics框架升级,该框架能将语言和视觉信息转化为机器人动作。与此同时,竞争对手OpenAI正探索融合视觉、语言和动作的通用模型,英伟达则通过软件平台助力开发者训练AI机器人,行业竞逐态势愈发激烈。

 
 
更多>同类内容
全站最新
热门内容