StereoVGGT:用于立体视觉的无训练式视几何变换器
计算机视觉与模式识别
2026-04-01 v1
摘要
随着3D设备的发展,包括立体匹配和立体转换在内的立体视觉任务已成为重要的研究前沿。当代立体视觉主干网络通常依赖于单目深度估计(MDE)模型或视觉基础模型(VFM)。关键在于,这些模型主要是在没有相机姿态显式监督的情况下进行预训练的。鉴于几何知识对立体视觉至关重要,缺乏显式空间约束构成了现有架构的显著性能瓶颈。我们意识到,视几何 grounding 变换器(VGGT)作为一种在大量3D先验知识(包括相机姿态)上进行预训练的基础模型,具有潜在的立体视觉任务强大 backbone 的能力。然而,实证结果表明,其直接应用于立体视觉性能并不理想。我们观察到,VGGT 在特征提取过程中几何细节的退化幅度更大。这种特征与双目立体视觉的要求相冲突,从而限制了其在相对任务中的效用。为弥合这一差距,我们提出了 StereoVGGT,一种专为立体视觉设计的特征 backbone。通过利用冻结的 VGGT 并引入无训练特征调整管道,我们减轻了几何退化,同时发掘了模型中潜在的相机标定知识。基于 StereoVGGT 的立体匹配网络在KITTI基准测试中获得所有已发布方法中的第1名,验证了 StereoVGGT 作为立体视觉高效 backbone 的能力。
引用
@article{arxiv.2603.29368,
title = {StereoVGGT: A Training-Free Visual Geometry Transformer for Stereo Vision},
author = {Ziyang Chen and Yansong Qu and You Shen and Xuan Cheng and Liujuan Cao},
journal= {arXiv preprint arXiv:2603.29368},
year = {2026}
}