中文

将图像翻译为道路网络:一种序列到序列的视角

计算机视觉与模式识别 2025-08-22 v3

摘要

道路网络的提取对于高精地图的生成至关重要,因为它能够精确定位道路地标及其相互连接。然而,由于欧几里得结构(例如道路地标位置)和非欧几里得结构(例如道路拓扑连通性)之间存在冲突的底层组合,生成道路网络面临重大挑战。现有方法难以有效融合这两种数据域,但很少有方法能妥善处理这一问题。相反,我们的工作通过将欧几里得和非欧几里得数据投影到一个称为 RoadNet Sequence 的整数序列中,建立了两种数据域的统一表示。除了建模一个自回归序列到序列的 Transformer 模型来理解 RoadNet Sequence 之外,我们将 RoadNet Sequence 的依赖性解耦为自回归和非自回归依赖性的混合。在此基础上,我们提出的非自回归序列到序列方法利用了非自回归依赖性,同时弥补了与自回归依赖性的差距,从而在效率和准确性上均取得了成功。我们进一步在数据集的无过拟合划分上识别出当前 RoadNetTransformer 的两个主要瓶颈:受限于 BEV 编码器的地标检测不佳,以及向拓扑推理的误差传播。因此,我们提出了拓扑继承训练,以将更好的拓扑知识继承到 RoadNetTransformer 中。此外,我们从开源地图数据集中收集 SD-Maps,并利用这些先验信息显著改善地标检测和可达性。在 nuScenes 数据集上的大量实验证明了 RoadNet Sequence 表示和非自回归方法相对于现有最先进替代方案的优越性。

关键词

引用

@article{arxiv.2402.08207,
  title  = {Translating Images to Road Network: A Sequence-to-Sequence Perspective},
  author = {Jiachen Lu and Ming Nie and Bozhou Zhang and Reyuan Peng and Xinyue Cai and Hang Xu and Feng Wen and Wei Zhang and Li Zhang},
  journal= {arXiv preprint arXiv:2402.08207},
  year   = {2025}
}

备注

V1 is the ICCV 2023 conference version, and V2 is the extended version