VIRD:通过双轴变换实现视角不变表示用于跨视图姿态估计
计算机视觉与模式识别
2026-03-24 v2
摘要
精确的全局定位对于自动驾驶和机器人领域至关重要,但由于遮挡和多径效应,GNSS-based方法往往性能下降。作为一种新兴替代方案,跨视图姿态估计通过预测对应于地视图图像的3-DoF相机姿态来实现,这些姿态相对于地理参考卫星图像。然而,现有方法在跨越地视图和卫星视图之间的显著视角差距方面存在困难,主要由于受限的空间对应关系。我们提出了一种新的跨视图姿态估计方法,通过双轴变换构建视角不变表示(VIRD)。VIRD首先对卫星视图应用极坐标变换以促进水平对应,然后在地视图和极坐标变换后的卫星特征上使用上下文增强位置注意力以缓解垂直误差,显式地跨越视角差距。为进一步加强视角不变性,我们引入一种视图重建损失,以鼓励派生表示重建原始和跨视图图像。在KITTI和VIGOR数据集上的实验表明,VIRD在无方向先验条件下优于当前最先进的方法,KITTI数据集上将中位数位置和姿态误差分别降低了50.7%和76.5%,VIGOR数据集上分别降低了18.0%和46.8%。
引用
@article{arxiv.2603.12918,
title = {VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation},
author = {Juhye Park and Wooju Lee and Dasol Hong and Changki Sung and Youngwoo Seo and Dongwan Kang and Hyun Myung},
journal= {arXiv preprint arXiv:2603.12918},
year = {2026}
}
备注
Accepted to CVPR 2026