机器人学习技能的门槛正在被一项名为HiFi-UMI的新技术大幅降低。这项由研究团队开发的系统,通过高精度手持设备记录人类操作,让机器人无需依赖真实机器人的示范数据即可掌握复杂任务。研究显示,使用HiFi-UMI采集的数据训练的机器人,在多项任务中的表现与依赖传统遥控示范数据的机器人几乎持平,甚至在某些场景下表现更优。
传统机器人学习方法依赖“示范视频加动作数据”的组合,但采集成本高昂。例如,此前有团队动用一百台双臂人形机器人,在四千平方米的专用场地中耗时良久才积累近三千小时的数据。为降低成本,学界曾尝试让人类直接用手持设备模拟机器人动作,但记录精度不足,仅能作为“预热训练”材料,最终仍需补充真实机器人数据“收尾”。HiFi-UMI的核心突破在于证明:只要手持设备记录足够精确,这一“收尾”步骤完全可以省略。
研究团队指出,传统手持设备的精度问题源于四大缺陷:轨迹追踪依赖视觉惯性里程计,误差随操作距离增加;双手协调数据由独立设备采集后拼接,对齐误差不可避免;传感器时间同步精度仅毫秒级,快速操作时误差显著;视野覆盖有限,遮挡或细节观察时易失效。针对这些问题,HiFi-UMI通过四项创新设计实现高精度采集:硬件触发器将传感器时间同步误差控制在40微秒以内;每只手安装两个广角鱼眼相机,配合头部立体相机实现200度视野覆盖;全掌手套式夹具模拟真实抓握感,提升操作自然度;实时质量监控功能可检测曝光、模糊等问题,并通过语音提示操作者纠正。
采集到的高保真数据需经过六阶段自动化处理流水线才能转化为机器人可用的训练集。其中,仿真复现验证是关键环节:研究团队为目标机器人开发全身运动控制算法,将重建轨迹在仿真器中“播放”,检查机械臂能否完成动作而不违反运动学或动力学约束。通过这一环节的轨迹合格率超过98%,叠加其他处理步骤后,原始数据最终保留率约96%,远高于行业平均水平。AI辅助标注模型可自动生成任务级和子任务级文字描述,人工核验则重点核查低置信度样本,确保标注准确性。
截至论文发布,HiFi-UMI系统已累计采集并处理超两万小时操作数据,涵盖四百八十余个场景、四百三十二万个完整样本。研究团队从中精选两千小时数据集HiFi-UMI-2K公开,包含四十八万余个样本,覆盖一百一十余个场景,采用知识共享CC BY 4.0协议允许商业用途。该数据集任务类型丰富,包括放置与插入、擦拭与清洁、取出与拾取等十余种操作,场景跨越厨房、卧室、浴室等日常环境。为保护隐私,所有出现人脸的画面均经过遮掩处理。
验证实验在两台配备七自由度力控机械臂的双臂平台上进行,测试四项代表性桌面任务:污渍擦拭、衬衫折叠、遥控器插入和食材分类。每项任务-策略组合测试四十次,测试前随机调整物体位置,评判标准为严格二元成功率。结果显示,使用HiFi-UMI数据训练的视觉-语言-动作模型StarVLA-QwenPI,四项任务综合成功率为51.3%,与使用遥控数据训练的53.8%差距仅2.5个百分点;另一模型OpenPI-π0.5的HiFi-UMI版本成功率达77.5%,甚至高于遥控版本的74.4%。世界-动作模型LingBot-VA的测试中,HiFi-UMI版本与遥控版本成功率差距仅0.6个百分点。这些结果证明,高精度手持数据可完全替代真实机器人示范数据。
研究还发现,大规模HiFi-UMI预训练可显著提升模型泛化能力。以StarVLA-QwenPI为例,使用四千小时多任务数据预训练后,模型对保留测试集的动作预测误差下降61%,且误差随训练量增加呈幂律下降。在十项未见任务的测试中,预训练使平均动作误差降低41%,其中刚性物体操作改善最快,衣物折叠改善最慢。这反映预训练数据构成的影响:抓取和放置刚性物体的操作占比超三分之一,而衣物折叠内容不足1%。预训练可降低任务专项训练的数据需求,例如遥控器插入任务中,预训练版本使用800个样本即超过从零开始训练使用3200个样本的成绩。
尽管成果显著,研究团队也坦言当前工作存在局限。例如,评测仅覆盖四项双臂桌面任务和三种策略骨架,结论对其他任务类型和机器人形态的普适性需进一步验证;每个任务-策略组合测试次数有限,细粒度任务差异难以可靠排序;精度提升的边际贡献未拆解,高精度数据的最低要求仍待探索;样本量差异反映两种采集方式的实际效率,而非人为设定不公平条件。尽管如此,这项研究仍为机器人学习领域开辟了新方向:通过高精度手持设备记录人类示范,可大幅降低机器人学习成本,推动技术更广泛落地。

















