中文

TALO:将 3D 视觉基础模型推向全球一致的在线重建

计算机视觉与模式识别 2026-03-19 v3

摘要

3D 视觉基础模型已在单次前向传递中通过未校准图像重建关键 3D 属性方面显示出强大的泛化能力。然而,在驾驶等在线场景中部署时,预测在时间窗口内进行,导致跨时间一致性难以维护。近期方法通过求解全局变换来对齐连续预测,但我们的分析揭示其在假设有效性、局部对齐范围和噪声几何下的鲁棒性方面存在根本性局限。本文提出一种基于单应函数(Thin Plate Spline)的高自由度和长期对齐框架,利用全局传播的控制点来纠正空间变异性不一致。此外,我们采用无点依赖的子图注册设计,天然对噪声几何预测更鲁棒。该框架完全模块化,可与多样的 3D 基础模型和相机配置(例如单摄像机或环视相机)兼容。广泛实验表明,我们的方法在多个数据集、主干模型和相机设置下均能获得更连贯的几何和更低的轨迹误差,凸显了其鲁棒性和通用性。代码已公开于 https://github.com/Xian-Bei/TALO。

关键词

引用

@article{arxiv.2512.02341,
  title  = {TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction},
  author = {Fengyi Zhang and Tianjun Zhang and Kasra Khosoussi and Zheng Zhang and Zi Huang and Yadan Luo},
  journal= {arXiv preprint arXiv:2512.02341},
  year   = {2026}
}

备注

CVPR 2026