研究背景:当LLM走出数字世界
2026年7月9日,Anthropic前沿红队(Frontier Red Team)发布了一项开创性研究——Claude Plays Robotics。这项研究首次系统性地评估了大语言模型在多种真实和仿真机器人上的控制能力,覆盖经典控制问题、四足机器人运动与导航、以及机械臂操作三大领域。研究团队包括Shmuel Berman、Michael Ilie、Jia Deng和Daniel Freeman,他们提出了一个核心问题:语言模型在数字世界中展现的逻辑推理和规划能力,能否迁移到需要精确3D理解的物理世界?
这不是一个简单的yes/no问题。研究团队给多个语言模型(包括Claude Opus 4到Mythos Preview、GPT-5.4、Gemini 3.1等)提供了不同类型的机器人——经典控制玩具、仿真四足和人形机器人、机械臂,以及真实的Unitree Go2四足机器人。关键在于,他们让模型通过四种不同抽象层次的控制接口来操控这些机器人,从最底层的直接控制关节扭矩,到最高层的向预训练策略发送自然语言指令。
四层控制接口:抽象层次决定成败
研究的核心设计在于四种控制接口的对比。第一层是直接控制(Direct Control),模型直接输出每个时间步的关节扭矩或力——这是最底层的控制方式,要求模型精确理解物理动力学。第二层是编程控制(Programmatic Control),模型编写Python控制器代码来映射观测到动作。第三层是策略控制(Policy Control),模型访问预训练策略并发出高层指令。第四层是强化学习监督(RL Supervision),模型从头训练一个策略并在测试时部署。
研究发现了一个关键结论:模型的机器人表现不取决于模型本身,而取决于控制接口。同一个模型在不同接口下可能表现截然不同。例如,GPT-5.4在直接控制下表现较差,但在训练强化学习策略时却成为唯一能在TwinFlipper任务中持续学习到有效策略的模型。这种非对称性表明,模型的能力分布与控制方法之间存在复杂的交互效应。
经典控制:从倒立摆到弹球机
在经典控制任务中,研究团队测试了倒立摆平衡、跳跃器速度控制,以及一个全新的TwinFlipper弹球任务。TwinFlipper要求模型控制一组弹板,通过精确的弹跳控制最大化球的滞空时间——这是一个混沌动态系统,所有模型在预训练中都未曾见过。
结果显示,Claude模型家族在代码控制、强化学习和直接控制方面都展现出持续的代际改进。Opus 4.6和4.5在几乎所有任务上都优于早期版本。更重要的是,改进主要来自模型更好地适应先前结果并修订策略的能力——在有自然终止点的任务上(如TwinFlipper和倒立摆),各模型的首次尝试表现差异不大,但后续尝试中较新模型的改进幅度显著更大。
低层运动控制:四足与人形的挑战
研究团队在Unitree Go2四足机器人和G1人形机器人上测试了低层运动控制。Go2有12个自由度,G1有29个自由度——控制复杂度远超经典任务。模型需要协调多个关节,同时持续补偿重力、惯性和接触力。
结果令人振奋也令人警醒。在编程控制下,Opus 4.6、4.7和Mythos Preview能让Go2保持近两秒的稳定平衡——足以展示稳定控制能力。但在直接控制下,即使是Opus 4.6也只能保持平衡,无法让机器人从倒地状态站起来。G1人形机器人更具挑战性:没有模型能成功让机器人从倒地姿态站起来,但Opus 4到4.7在已站立状态下的平衡控制确实有可测量的进步。
值得注意的是,当前非推理推理的延迟约为0.2-0.4Hz,而实时控制需要约83Hz——差距约为两个数量级。研究团队通过在LLM调用之间暂停模拟器来近似上限性能,这排除了延迟因素对结果的影响。
高层控制:预训练策略的乘数效应
当模型获得更高层次的抽象——预训练运动策略和视觉语言动作(VLA)模型——性能大幅提升。在高层运动控制中,模型通过预训练步态策略控制四足机器人,发送速度指令(前进、横向、偏航)并定期接收前方RGB摄像头画面。
研究设计了11个导航和空间推理任务,从简单的目标寻找到复杂的迷宫导航、漂移检测和空间记忆任务。结果显示,高层运动控制在两个明显的模型代际跃迁中改进:Claude Opus 4.1到4.5之间,以及Opus 4.7到Mythos Preview之间。一个有趣的发现是,指南针工具(仅提供模型朝向角度)对所有配置的提升效果最大——这表明模型主要需要更好的方向感,而非不同的场景视角。
在高层操控中,VLA策略的作用更加戏剧性。在标准40任务LIBERO基准上,VLA将操控能力从直接控制的几乎为零提升到显著水平。Opus 4.5、4.6和4.7在遵循VLA指令方面表现最佳,且在VLA出错时能更好地识别并拒绝错误建议。Mythos Preview甚至能在VLA完全无法完成的新任务上提供净提升。
视觉感知:模型如何「看见」世界
研究团队深入测试了各种视觉辅助工具的效果。在操控任务中,深度图和分割覆盖层大致中性——它们传达了正确类型的信息,但信号太分散。在运动任务中,深度热图和十字准星覆盖层同样接近中性。但光标工具(在机械臂摄像头画面上的红色X标记)给每个模型带来大幅提升——对Mythos Preview来说,10个任务子集的成功率从6%跳到32%。
最具启发性的是RGB图像与文本描述的对比测试。用最强视觉问答模型Gemini 3.1生成的文本场景描述替代原始图像后,旧模型表现更好——说明它们难以从像素中提取足够的空间细节。而Opus 4.6和4.7用文本替代后表现略差,说明原始视觉输入包含对它们有用的信息。这表明新模型在直接从图像提取空间信息方面已有实质性进步。
在真实Unitree Go2的实验中,团队观察到一个生动案例:当机器人在走廊中略微偏离轴线行走时,Opus 4.6利用中心准星判断对齐情况,注意到走廊向左漂移,推断自己可能面向过右,然后进行了纠正。但准星有时也会分散对障碍物的注意力——机器人看到前方有垃圾桶时,正确识别了它,却因为垃圾桶在准星左侧而判断不会碰撞,实际上垃圾桶恰好挡住了去路。
安全启示:能力评估的新维度
这项研究对AI安全领域有深远影响。最核心的启示是:在隔离环境中测试模型会严重低估其在机器人系统中的实际能力。一个仅凭自身能力表现有限的模型,在获得预训练策略访问权后可能变得极为能干。这对当前以模型为中心的能力评估范式提出了根本性质疑。
研究明确指出,前沿模型已经可以在没有预训练策略的情况下,通过编写和下载工具来缓慢行走四足机器人穿越迷宫,或者从台面上拾起盘子放到炉灶上——尽管可靠性仍有待提高,但每一代模型都在缩小这一差距。这意味着通用聊天模型无需任何机器人训练,就能对物理世界产生有意义的影响。
未来展望:从实验室走向现实
研究团队在论文中坦承,当前模型在需要稳定空间记忆、自我定位或长时间开环规划的任务上仍然失败。但趋势是明确的:模型在机器人领域的能力正在快速提升,且改进是不均匀的——高层接口的进步最为稳定和显著。
这项研究的意义超越了技术本身。当一个通用语言模型能够通过监督预训练控制器来完成真实导航和操控任务时,AI系统与物理世界之间的边界正在被重新定义。Anthropic通过这项研究不仅展示了Claude家族在机器人领域的能力进步,更重要的是为整个行业提供了一个评估和理解LLM物理世界能力的系统框架——这可能是通往更安全、更可靠的具身AI的关键一步。
参考来源:Anthropic Frontier Red Team, "Claude Plays Robotics", 2026年7月9日。原文链接:https://www.anthropic.com/research/claude-plays-robotics