中文

TS-CGNet:时空融合结合中心线引导扩散的 BEV 建图

计算机视觉与模式识别 2025-03-05 v1 机器人学 图像与视频处理

摘要

鸟瞰图(BEV)感知技术对自动驾驶至关重要,它生成用于环境感知、导航和决策的自上而下的二维地图。然而,当前大多数专注于视觉地图生成的 BEV 地图生成研究缺乏深度感知推理能力。它们在处理遮挡和复杂环境方面效果有限,在恶劣天气条件或低光场景下感知性能显著下降。因此,本文提出 TS-CGNet,它利用时空融合与中心线引导扩散。这个基于先验知识的视觉框架旨在集成到任何现有网络中以构建 BEV 地图。具体而言,该框架被解耦为三部分:局部建图系统涉及仅使用视觉信息初步生成语义地图;时空对齐模块(TSAM)通过应用变换矩阵将历史信息集成到地图生成中;中心线引导扩散模型(CGDM)是基于扩散模型的预测模块。CGDM 通过空间注意力机制结合中心线信息,以增强语义分割重建。我们在公开的 nuScenes 及各种损坏下的鲁棒性基准上,通过我们的方法构建了 BEV 语义分割地图。在 BEV 高精地图任务中,对于 60x30m、120x60m 和 240x60m 的感知范围,我们的方法分别提升了 1.90%、1.73% 和 2.87%。在 BEV 语义建图任务中,对于 100x100m 的感知范围,TS-CGNet 实现了 1.92% 的提升。此外,在 240x60m 的感知范围内,在不同天气条件和传感器干扰下,TS-CGNet 在检测精度上实现了 2.92% 的平均提升。源代码将在 https://github.com/krabs-H/TS-CGNet 公开。

关键词

引用

@article{arxiv.2503.02578,
  title  = {TS-CGNet: Temporal-Spatial Fusion Meets Centerline-Guided Diffusion for BEV Mapping},
  author = {Xinying Hong and Siyu Li and Kang Zeng and Hao Shi and Bomin Peng and Kailun Yang and Zhiyong Li},
  journal= {arXiv preprint arXiv:2503.02578},
  year   = {2025}
}

备注

The source code will be publicly available at https://github.com/krabs-H/TS-CGNet