HOLO:基于仿射变换引导的SD图上的精细视觉定位姿态估计网络
计算机视觉与模式识别
2026-01-08 v2
摘要
视觉定位已成为一种具有低成本和可扩展性的自主驾驶解决方案。然而,现有的基于回归的方法往往忽视了固有的几何先验,导致训练效率不足以及定位精度受限。本文提出一种新颖的仿射变换引导的姿态估计网络,用于在多视图图像与标准定义(SD)地图之间进行精细视觉定位。我们构建满足仿射约束的输入对,通过将地面视角特征投影到BEV域并强制语义与地图特征对齐。随后,我们利用仿射关系引导特征融合,并将姿态输出限制在有效可行区域,从而显著提升了训练效率和定位精度,与依赖注意力机制融合和直接3自由度姿态回归的先前方法相比优势明显。我们认为这是首个将BEV语义推理与仿射学习统一用于图像到地图定位的工作。此外,通过显式建模仿射变换,该框架自然支持跨分辨率输入,增强了模型的灵活性。大量实验在nuScenes数据集上表明,我们的方法显著优于现有的领先视觉定位方法。代码和预训练模型将公开 release,以促进未来研究。
引用
@article{arxiv.2601.02730,
title = {HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps},
author = {Xuchang Zhong and Xu Cao and Jinke Feng and Hao Fang},
journal= {arXiv preprint arXiv:2601.02730},
year = {2026}
}