高德推出ABot-Recon流式3D重建模型:精度速度双提升 显存占用大幅降低

   发布时间:2026-08-28 13:28 作者:陆辰风

在自动驾驶与具身智能技术加速向开放场景渗透的背景下,物理AI系统对动态空间理解的需求愈发迫切。传统3D重建方案在商场、园区等私域场景中面临定位信号弱、环境变化快等挑战,一次性建图或事后重建模式难以满足实时性要求。针对这一痛点,阿里巴巴旗下高德团队推出全球首个无长程依赖的万帧级流式3D重建模型ABot-Recon,通过创新技术路径实现"边拍摄边建模"的突破性进展。

传统流式3D重建技术存在"记忆困境":为维持长距离场景的全局一致性,模型需通过记忆锚点持续保存历史信息,导致计算复杂度随序列长度呈指数级增长。这种技术路径在处理超长视频时,往往出现速度骤降、精度衰减、显存爆炸等问题。ABot-Recon独辟蹊径,采用"局部位姿预测+残差优化"双引擎架构,仅以连续12帧画面作为动态上下文窗口,通过预测局部点云与相邻帧相对位姿,将计算复杂度锁定在恒定水平。

该模型的创新性体现在三方面:在预测机制上,通过在线组合局部轨迹逐步拼合全局场景,彻底摆脱对长程记忆的依赖;在误差控制方面,构建预测端实时纠偏与训练端约束优化的双保险机制;在资源占用上,单帧计算量与内存需求不随视频长度增加,使消费级显卡即可承载万帧级重建任务。技术白皮书显示,在Oxford Spires长序列测试中,ABot-Recon的平均轨迹误差较行业标杆LingBot-Map降低40.6%,旋转误差控制在0.12°的顶尖水平。

实测数据印证了技术突破的实用性:在KITTI-02场景中,模型以24.45FPS的速率实现实时重建,推理速度达同类方案的1.24倍。更值得关注的是,其峰值显存占用仅6.71GB,相当于主流模型的三分之一,这意味着GTX 1080Ti等消费级显卡即可驱动系统运行。这种轻量化特性大幅降低了技术落地门槛,为测绘、自动驾驶、3D内容生产等领域提供高性价比解决方案。

该模型另一革命性突破在于输入要求的极致简化。通过单目RGB视频即可完成万帧级三维重建,无需深度传感器或预先标定的相机参数。这种"即拍即建"的能力使其在私域建图、动态场景更新等场景中展现独特优势。目前,研发团队已在GitHub开源推理代码与训练权重,并在魔搭社区开设体验专区,推动技术生态的开放共建。

 
 
更多>同类内容
全站最新
热门内容