中文

V2X-ViT:基于视觉Transformer的车路协同感知

计算机视觉与模式识别 2022-08-09 v3

摘要

本文中,我们研究利用车联网(Vehicle-to-Everything, V2X)通信来改善自动驾驶车辆的感知性能。我们提出了一种利用新颖视觉Transformer的鲁棒协同感知框架(含V2X通信)。具体而言,我们构建了名为V2X-ViT的整体注意力模型,以有效融合道路上智能体(即车辆与基础设施)之间的信息。V2X-ViT由异质多智能体自注意力与多尺度窗口自注意力交替层组成,可捕获智能体间交互与智能体内空间关系。这些关键模块设计于统一Transformer架构中,以应对常见V2X挑战,包括异步信息共享、位姿误差及V2X组件异构性。为验证我们的方法,我们使用CARLA与OpenCDA创建了大规模V2X感知数据集。大量实验结果表明,V2X-ViT在3D目标检测上确立了新的最先进水平,并即使在恶劣噪声环境下也取得鲁棒性能。代码见 https://github.com/DerrickXuNu/v2x-vit。

关键词

引用

@article{arxiv.2203.10638,
  title  = {V2X-ViT: Vehicle-to-Everything Cooperative Perception with Vision Transformer},
  author = {Runsheng Xu and Hao Xiang and Zhengzhong Tu and Xin Xia and Ming-Hsuan Yang and Jiaqi Ma},
  journal= {arXiv preprint arXiv:2203.10638},
  year   = {2022}
}

备注

ECCV 2022. Code: https://github.com/DerrickXuNu/v2x-vit