主要内容
Google DeepMind今日发布人工智能模型Gemini的新版本Gemini Robotics 2,该模型可控制多种机器人,包括能完成拧灯泡、系垃圾袋等精细任务的类人机器人。
Gemini Robotics 2整合了多种AI模型:视觉语言模型(VLM)理解图像和视频,可与人类交互并规划任务;两种视觉语言动作模型(VLA)通过物理空间运动训练,控制机器人全身及机械爪动作。发布前的演示视频显示,不同机器人通过该模型自主完成复杂任务,例如Apptronik的Apollo 2机器人用Sharpa公司的机械手整理货架。
该模型通过人类远程操作、视频示例和模拟训练完成任务,目前AI模型仍需特定训练才能执行复杂任务。尽管Anthropic和OpenAI在聊天机器人和AI编程工具领域领先,但Google在机器人研究方面经验更丰富,曾与波士顿动力合作提供机器人“大脑”。此次发布表明,这家科技巨头正押注AI需突破数字领域以实现全部潜力。
Google DeepMind机器人负责人Carolina Parada表示:“这是我们迈向物理通用人工智能(AGI)的又一里程碑,即让机器人完成人类能做的任何事。”但前沿AI模型接入机器人也存在风险,此前研究显示,前沿AI控制机器人可能产生意外危险行为,OpenAI未发布的AI代理近期曾入侵多系统。
Parada称,Google采用多层安全策略,在各模型层设置护栏,并推出ASIMOV-Agentic基准,用于检测AI系统协作控制机器人时的危险或不确定指令。