基于 BEV 条件 GPS 去噪的扩散模型 2D 地图视觉定位
计算机视觉与模式识别
2026-02-04 v2
摘要
准确的视觉定位对自动驾驶至关重要,但现有方法面临根本性困境:虽然高清(HD)地图提供高精度定位参考,但其昂贵的构建和维护阻碍了可扩展性,这推动了研究采用标准定义(SD)地图如 OpenStreetMap。当前的 SD-地图方法主要关注图像与地图之间的鸟瞰视角(BEV)匹配,忽略了普遍存在的信号-噪 GPS。虽然 GPS 随时可用,但在城市环境中会受到多径误差。我们提出 DiffVL,将视觉定位重新表述为 GPS 去噪任务,使用扩散模型。我们的关键见解是,受视觉 BEV 特征和 SD 地图条件约束的噪声 GPS 轨迹隐式地编码了真实姿态分布,可通过迭代扩散细化来恢复。与现有的 BEV-匹配方法(如 OrienterNet)或基于转换器的注册方法不同,DiffVL 通过联合建模 GPS、SD 地图和视觉信号来学习逆转 GPS 噪声扰动,无需依赖 HD 地图即可实现亚米级精度。实验在多个数据集上表明,我们的方法在 BEV-匹配基线中实现了业界最高的精度。关键的是,我们的工作证明了扩散模型可以通过将噪声 GPS 作为生成先验实现可扩展的定位,这标志着从传统基于匹配的方法向新的范式转变。
关键词
引用
@article{arxiv.2509.14565,
title = {DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising},
author = {Li Gao and Hongyang Sun and Liu Liu and Yunhao Li and Yang Cai},
journal= {arXiv preprint arXiv:2509.14565},
year = {2026}
}