中文

前馈式三维重建模型中的几何理解与学习先验

计算机视觉与模式识别 2026-03-18 v2

摘要

DUSt3R、VGGT 和 Depth Anything 3(DA3)等前馈式三维重建模型是基于 Transformer 的基础模型,通过单次前向传播推断相机几何和密集场景结构。它们以大规模监督方式训练,引发了一个核心问题:这些模型是建立在类似于传统多视角流水线的几何原理之上,还是主要依赖于大规模训练设置产生的学习先验?我们发现极线几何出现在所有三个模型的中间层中,并与注意力头中的对应模式存在因果关系。为了研究这一点,我们在三个真实世界数据集和一个受控合成数据集上对它们的内部表示进行了系统分析。我们通过探测中间特征、分析注意力模式以识别对应匹配模式,以及在注意力层面进行针对性干预来量化几何理解。进一步,我们通过应用具有挑战性的输入级扰动(如遮挡、场景模糊和变化的相机配置)来评估学习先验的作用,并将其与经典的多阶段重建流水线进行比较。

关键词

引用

@article{arxiv.2512.11508,
  title  = {On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models},
  author = {Jelena Bratulić and Sudhanshu Mittal and Thomas Brox and Christian Rupprecht},
  journal= {arXiv preprint arXiv:2512.11508},
  year   = {2026}
}