一份由国内银河通用团队完成、发布于 GitHub 的仿真测评报告在具身智能行业引发震动。GPT‑6 Astra 搭配 π0.5 动作先验模型组成混合架构,在 RoboDojo 机器人双臂操作基准拿到 62.6 分,相比第二名性能高出 64%,验证了 “大模型负责高层认知、具身模型负责物理动作” 这条新的技术路径,同时也为国内具身智能产业敲响警钟。
实验设置两套方案:Direct 模式由 GPT‑6 Astra 直接输出机器人动作;混合模式由 π0.5 先生成大量候选动作,GPT‑6 Astra 只在关键节点做任务理解、异常判断与局部修正,仅修改全部控制步骤里14.4%的执行环节,大部分物理操作依旧交给 π0.5 完成36氪。
测评结果反差明显: ✅ RoboDojo 复杂操作任务:纯 Astra 直接控制成功率仅 26%;混合架构提升至48%,搭塔、叠衣服、精细抓取等物理操作得分大幅上涨。 ✅ RoboLab 语义理解任务:只靠 GPT‑6 Astra 零样本就实现 98% 任务成功率,擅长物体识别、空间推理、任务纠错,可形成 “观察‑决策‑执行‑复盘” 闭环。 ❌ 短板同样突出:单纯大模型在搭塔、麻将杠牌等精细接触任务近乎失效。能看懂目标,不等于可以稳定操控物理世界,精细抓取、碰撞控制仍是大模型天然短板36氪。
这揭示关键结论:通用大模型擅长任务规划、语义推理,但缺少物理交互先验;具身动作模型熟悉真实物理操作,但泛化理解能力弱,二者具备极强互补性。
这份亮眼成绩是仿真环境下的能力边界测试,距离真实机器人落地还有不小距离。混合架构单次实验 Token 消耗达到6.25 亿,纯 Astra 直接控制超过 11.3 亿 Token,推理开销巨大,很难满足实体机器人低延迟高频控制要求。现实场景还叠加相机噪声、机械误差、安全约束等多重变量,仿真效果不能直接等价真机表现。
OpenAI 已经投入百亿级资源,储备上千万小时量级具身交互数据。巨额投入换来了认知层能力跃升,但高 Token 消耗、软硬件适配难题依旧没有彻底解决,路线本身并不完美。
国内拥有完整机器人硬件供应链、制造业海量真实场景,但场景优势不会自动转化为模型能力。最大挑战在于如何把工厂、物流现场的真实问题沉淀为高质量交互数据,完成 “场景采集‑训练迭代‑真机验证” 的数据飞轮闭环。
硬件供应链只是底座,真正比拼的是高质量具身数据储备、大规模算力供给,以及仿真与真机之间迁移能力。单纯复刻海外路线不现实,国内产业要发挥本土场景优势,补齐数据短板,寻找适配自身的混合架构方案。
具身智能新范式已经浮现:通用大模型拉高认知泛化上限,具身动作模型补齐物理执行短板。海外已经验证这条路径可行性,但成本、部署难题仍悬而未决。对国内企业而言,硬件只是起点,数据、算力、仿真‑真机闭环,才是决定未来竞争胜负的核心。