Loc$^2$:基于深度提升局部特征匹配的可解释跨视角定位
计算机视觉与模式识别
2026-02-27 v3
摘要
我们提出了一种准确且可解释的细粒度跨视角定位方法,该方法通过将地面图像的局部特征与参考航空图像进行匹配,来估计地面图像的 3 自由度(DoF)姿态。与依赖全局描述符或鸟瞰图(BEV)变换的先前方法不同,我们的方法利用来自相机姿态的弱监督直接学习地面-航空图像平面对应关系。匹配的地面点通过单目深度预测被提升到 BEV 空间,然后应用尺度感知 Procrustes 对齐来估计相机旋转、平移,以及可选地估计相对深度与航空度量空间之间的尺度。该公式轻量、端到端可训练,且不需要像素级标注。实验表明,在跨区域测试和未知方向等具有挑战性的场景中,该方法达到了最先进的精度。此外,我们的方法提供了强大的可解释性:对应质量直接反映了定位精度,并能够通过 RANSAC 进行外点剔除,而将重新缩放的地面布局叠加在航空图像上则提供了定位性能的直观视觉线索。
引用
@article{arxiv.2509.09792,
title = {Loc$^2$: Interpretable Cross-View Localization via Depth-Lifted Local Feature Matching},
author = {Zimin Xia and Chenghao Xu and Alexandre Alahi},
journal= {arXiv preprint arXiv:2509.09792},
year = {2026}
}