当机器人不再满足于在舞台上完成预设动作,具身智能行业正经历一场从“身体展演”到“大脑竞争”的深刻转型。过去两年,观众对机器人表演的惊叹逐渐被理性追问取代:这些机械动作究竟有多少自主性?能否在陌生环境中完成任务?这些疑问折射出行业对“大脑”的迫切需求——没有自主决策能力,具身智能终将沦为传统自动化技术的延伸。
数据获取成为制约机器人智力发展的首要瓶颈。谷歌团队曾耗时17个月、投入千万美元,仅采集23万条真机轨迹数据。这种线性增长模式导致数据积累成本高昂,且场景迁移需重新采集。智元科技通过量产机器人构建数据闭环,其AgiBot World数据集包含超百万条轨迹,覆盖217个任务场景,使策略预训练效果提升30%。但真机数据的重资产属性,迫使中小企业转向合成数据方案。
银河通用公司提出的“99%合成数据+1%真机数据”模式引发关注。其研发的SynGrasp-1B数据集包含十亿级仿真抓取数据,训练出的GraspVLA模型抓取成功率达98.3%。在零售场景中,机器人通过百亿级合成数据预训练后,仅需一天真机数据即可完成微调。这种“模拟题+真题”的组合策略,将数据成本压缩至传统方法的百分之一,为中小企业开辟了新路径。
算法架构创新成为突破数据依赖的关键。Physical Intelligence公司摒弃机器人本体制造,专注模型设计,通过在线强化学习实现小时级连续工作。星海图团队则经历架构迭代:从2025年开源的双系统VLA设计,到2026年将推理控制统一为自回归序列的单模型架构。这种变革使语言模型直接驱动动作,动作表现继承大语言模型的扩展规律,显著提升物理交互能力。
智元科技提出的ViLLA架构另辟蹊径,通过“隐式动作标记”中间层,将语义理解与动作生成解耦。该架构支持人类视频和异构机器人数据训练,其GO-1模型在“倒水”“补货”等任务中,成功率超越主流模型。这些探索印证了行业共识:相同数据在不同架构下可能产生截然不同的效果,算法设计正在成为核心竞争力。
世界模型被视为解决“仿真到现实”鸿沟的终极方案。星动纪元团队将世界模型嵌入VLA原生架构,使模型具备“预演-修正”能力。其ERA-42模型通过脑内想象画面反推动作,VLAW系统则实现世界模型与策略的协同优化。这种“让机器人做梦”的训练方式,虽面临工程挑战,但为突破物理常识学习瓶颈提供了新思路。
当前人形机器人市场的泡沫争议,本质是对“大脑”缺失的警示。判断企业真实价值需考察四个维度:是否拥有基础模型、持续数据采集能力、数据模型转化能力、模型技能泛化能力。宇树科技创始人王兴兴提出的“家庭场景80%任务自主完成”标准,正是对机器人大脑的终极考验。这场智力竞赛中,数据、算法、架构的突破仍在持续,而真正的赢家,必将是那些能让机器人“开窍”的技术派。




















