中文

GPA-VGGT:基于几何与物理感知损失的自监督学习适用于大规模定位的VGGT

计算机视觉与模式识别 2026-04-03 v3 机器人学

摘要

基于Transformer的通用视觉几何框架在相机姿态估计和3D场景理解方面显示出良好的性能。最近VGGT(Visual Geometry Grounded Transformer)模型的进展在相机姿态估计和3D重建方面表现突出。然而,这些模型通常依赖于训练的地面实况标签,在适应未标记且不可见的场景时面临挑战。本文提出了一种自监督框架,用于训练VGGT以增强其在大规模环境中的定位能力。为实现此目标,我们将常规的双向关系扩展为序列级几何约束,用于自监督学习。具体而言,在每个序列中,我们采样多个源帧并几何投影到不同的目标帧,这有助于提高时序特征一致性。我们将物理光谱一致性和几何约束 formulated as a joint optimization loss 以规避对硬标签的需求。通过采用本文提出的方法训练模型,不仅本地和全局跨视图注意力层,还可以有效捕获底层的多视图几何。实验表明,模型在数百个迭代后即可收敛,并在大规模定位方面实现了显著的改进。我们的代码将发布在 https://github.com/X-yangfan/GPA-VGGT。

关键词

引用

@article{arxiv.2601.16885,
  title  = {GPA-VGGT:Adapting VGGT to Large Scale Localization by Self-Supervised Learning with Geometry and Physics Aware Loss},
  author = {Yangfan Xu and Lilian Zhang and Xiaofeng He and Pengdong Wu and Wenqi Wu and Jun Mao},
  journal= {arXiv preprint arXiv:2601.16885},
  year   = {2026}
}