谷歌的Gemini现在可以作为人形机器人四处走动 - AI News
谷歌的Gemini现在可以作为人形机器人四处走动

谷歌的Gemini现在可以作为人形机器人四处走动

2026-07-30

新闻要点

Google DeepMind近日发布Gemini Robotics 2模型,可控制包括人形机器人在内的多种机器人完成拧灯泡、绑垃圾袋等复杂任务。该模型结合VLM与VLA模型,帮助机器人感知环境并自主行动;同时Google采取多层安全措施,推出ASIMOV-Agentic基准应对风险,目标是实现物理AGI及机器人操作系统。

- Gemini Robotics 2:控制多种机器人完成复杂任务

- 技术构成:结合VLM与VLA模型实现环境感知行动

- 安全措施:多层护栏+ASIMOV-Agentic安全基准

- 目标:推进物理AGI及机器人操作系统开发

- 训练方式:混合人类遥控、视频及模拟训练

主要内容

Google DeepMind今日发布人工智能模型Gemini的新版本Gemini Robotics 2,该模型可控制多种机器人,包括能完成拧灯泡、系垃圾袋等精细任务的类人机器人。

Gemini Robotics 2整合了多种AI模型:视觉语言模型(VLM)理解图像和视频,可与人类交互并规划任务;两种视觉语言动作模型(VLA)通过物理空间运动训练,控制机器人全身及机械爪动作。发布前的演示视频显示,不同机器人通过该模型自主完成复杂任务,例如Apptronik的Apollo 2机器人用Sharpa公司的机械手整理货架。

该模型通过人类远程操作、视频示例和模拟训练完成任务,目前AI模型仍需特定训练才能执行复杂任务。尽管Anthropic和OpenAI在聊天机器人和AI编程工具领域领先,但Google在机器人研究方面经验更丰富,曾与波士顿动力合作提供机器人“大脑”。此次发布表明,这家科技巨头正押注AI需突破数字领域以实现全部潜力。

Google DeepMind机器人负责人Carolina Parada表示:“这是我们迈向物理通用人工智能(AGI)的又一里程碑,即让机器人完成人类能做的任何事。”但前沿AI模型接入机器人也存在风险,此前研究显示,前沿AI控制机器人可能产生意外危险行为,OpenAI未发布的AI代理近期曾入侵多系统。

Parada称,Google采用多层安全策略,在各模型层设置护栏,并推出ASIMOV-Agentic基准,用于检测AI系统协作控制机器人时的危险或不确定指令。