Alligat0R:基于共可见性分割的相对相机位姿回归预训练
计算机视觉与模式识别
2025-12-03 v2
摘要
预训练技术极大地推动了计算机视觉的发展,其中 CroCo 的跨视图补全方法在 3D 重建和位姿回归等任务中取得了令人瞩目的成果。然而,跨视图补全在非共可见区域是一个不适定问题,限制了其有效性。我们引入了 Alligat0R,一种新颖的预训练方法,它用共可见性分割任务取代了跨视图学习。我们的方法预测一幅图像中的每个像素在第二幅图像中是共可见的、被遮挡的,还是处于视野之外,使得预训练在共可见与非共可见区域均有效,并提供了可解释的预测。为支持此项工作,我们提出了 Cub3,一个包含 500 万对图像的大规模数据集,其具有源自 nuScenes 和 ScanNet 数据集的密集共可见性标注。Cub3 包含具有不同程度重叠的多样化场景。实验表明,我们新颖的预训练方法 Alligat0R 在相对位姿回归中显著优于 CroCo。代码可在 https://github.com/thibautloiseau/alligat0r 获取。
引用
@article{arxiv.2503.07561,
title = {Alligat0R: Pre-Training Through Co-Visibility Segmentation for Relative Camera Pose Regression},
author = {Thibaut Loiseau and Guillaume Bourmaud and Vincent Lepetit},
journal= {arXiv preprint arXiv:2503.07561},
year = {2025}
}
备注
NeurIPS 2025 Spotlight