在三维重建技术领域,一项突破性成果正引发广泛关注。大晓机器人携手南洋理工大学 S-Lab 以及上海人工智能实验室,共同推出了全新的人–场景交互重建研究 HSImul3R。该研究聚焦于三维视觉领域长期存在的“感知—仿真鸿沟”难题,致力于推动三维重建从追求“视觉正确”迈向“物理可执行”的新阶段,其成果已被全球计算机视觉顶级会议 ECCV 2026 正式接收。
传统的人–场景交互重建方法,主要将关注点放在人和场景是否重建得逼真、是否对齐上。而 HSImul3R 独辟蹊径,把重力稳定性、真实接触与交互稳定性纳入核心评价标准。研究团队将其定义为首个面向非标定稀疏视角输入,能够实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并且支持单目视频输入。与此同时,团队还构建了面向人–场景交互的 HSIBench,用于直接检验重建结果能否在物理仿真中实现稳定交互。
在实验数据方面,HSImul3R 表现亮眼。在 Easy、Medium、Hard 三档任务中,其交互稳定率分别达到 53.68%、30.56% 和 13.92%,远高于 HSfM 的 10.52%、4.50% 和 2.66%。同时,人–场景三维穿模率从 HSfM 的 69.51% 大幅降至 22.90%。这些数据充分彰显了 HSImul3R 在提升人–场景交互稳定性、降低穿模率方面的显著优势。
为了达成从“视觉正确”到“物理成立”的目标,HSImul3R 创新性地提出了物理闭环(Physics-in-the-Loop)双向优化框架。这一框架让物理仿真器不再仅仅是最终检验工具,而是成为重建过程中的主动监督者。具体而言,一方面通过面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,确保人体运动既符合物理规律,又能与当前场景稳定交互;另一方面,借助直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),利用交互后的仿真反馈反向优化三维场景。
在物理闭环优化过程中,让恢复的人体运动适应当前场景是首要任务。传统动作跟踪与强化学习往往更注重人体自身的稳定性以及动作与原始轨迹的接近程度,却容易忽略人–物交互关系。例如,一段“坐在椅子上”的动作经过普通运动优化后,人体可能为保持平衡而偏离椅子,导致原本的交互消失。而 HSImul3R 的面向场景的强化学习,通过人体关键接触点与物体表面的空间关系,使优化后的动作既忠实于原始观测,又能与当前场景保持正确、稳定的接触,真正实现物理交互。
然而,仿真失败的原因并非总是人体动作错误,场景重建不准确也可能导致这一问题。特别是在人类遮挡严重、桌腿或椅腿等结构较细的场景中,图像生成三维模型(Image-to-3D)容易出现结构缺失或几何畸变,即使人体动作合理,也无法支撑真实交互。针对这一情况,HSImul3R 在反向过程中采用直接仿真奖励优化(DSRO),直接利用物理仿真的交互结果作为监督信号,反向优化三维物体生成模型,将评价标准从“物体自身能否站稳”提升为“人与它交互之后能否稳定”。
为了验证新的评价体系,团队构建了面向人–场景交互的 HSIBench。该数据集包含 19 个场景物体、超过 50 段人体动作序列和 300 个独立交互实例,由 3 名参与者完成,每个案例均从 16 个视角同步采集。与传统三维重建基准关注几何误差不同,HSIBench 将人–场景交互稳定性(Stability-HSI)作为核心指标之一,不仅要求物体在重力下稳定,还要求整个交互进入仿真后保持稳定,并保留有意义的人–物接触。
HSImul3R 的意义不仅在于稳定的物理仿真,更在于将经过物理优化的人体动作迁移到真实人形机器人上,实现从仿真到真实世界(Sim-to-Real)的跨越。团队先将优化后的人体运动重定向至 Unitree G1,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终直接部署到真实 G1 上,使机器人能够在现实环境中复现相应的人—场景交互。这一过程实现了从人类视频中的行为到真实机器人执行的完整转换,为机器人学习真实物理技能提供了新的途径。





















