中文

VQ-Map:通过向量量化在标记化离散空间中进行鸟瞰图地图布局估计

计算机视觉与模式识别 2024-11-05 v1 人工智能

摘要

鸟瞰图(BEV)地图布局估计需要对自车周围环境的语义元素进行准确且全面的理解,以使结果连贯且真实。由于遮挡、不利的成像条件和低分辨率带来的挑战,生成与透视视图(PV)中损坏或无效区域相对应的 BEV 语义地图在近期非常具有吸引力。问题是:如何将 PV 特征与生成模型对齐以促进地图估计。在本文中,我们提出利用一种类似于向量量化变分自编码器(VQ-VAE)的生成模型,在标记化离散空间中获取高级 BEV 语义的先验知识。由于获得的 BEV 标记伴随着封装了真实地图中不同 BEV 元素语义的代码本嵌入,我们能够将稀疏主干图像特征直接与从离散表示学习中获得的 BEV 标记对齐,最终通过 BEV 代码本嵌入作为 PV 和 BEV 之间的桥梁,生成高质量的 BEV 地图。我们在我们称为 VQ-Map 的模型上评估了 BEV 地图布局估计性能,在 nuScenes 和 Argoverse 基准测试上均取得了结果,在 nuScenes 上实现了 62.2/47.6 的平均 IoU(全景视图/单目评估),在 Argoverse 上实现了 73.4 的单目 IoU,均创下了该地图布局估计任务的新纪录。代码和模型可在 \url{https://github.com/Z1zyw/VQ-Map} 获取。

关键词

引用

@article{arxiv.2411.01618,
  title  = {VQ-Map: Bird's-Eye-View Map Layout Estimation in Tokenized Discrete Space via Vector Quantization},
  author = {Yiwei Zhang and Jin Gao and Fudong Ge and Guan Luo and Bing Li and Zhaoxiang Zhang and Haibin Ling and Weiming Hu},
  journal= {arXiv preprint arXiv:2411.01618},
  year   = {2024}
}