中文

HM-ViT:基于视觉变换器的异模态车对车协同感知

计算机视觉与模式识别 2023-04-24 v1

摘要

车对车技术已使自动驾驶车辆能够共享信息以看穿遮挡,极大提升了感知性能。然而,现有工作均聚焦于同质交通,即车辆配备相同类型传感器,这严重限制了协作规模与跨模态交互的益处。本文研究多智能体异模态协同感知问题,其中智能体可能具有不同传感器模态。我们提出 HM-ViT,首个统一的多智能体异模态协同感知框架,可对具有高动态车对车(V2V)协作(智能体数量与类型可变)的 3D 物体进行协同预测。为有效融合多视角图像与 LiDAR 点云特征,我们设计了一种新颖的异质 3D 图变换器,以联合推理智能体间与智能体内的交互。在 V2V 感知数据集 OPV2V 上的大量实验表明,HM-ViT 优于 V2V 异模态协同感知的 SOTA 协同感知方法。我们将发布代码以促进未来研究。

关键词

引用

@article{arxiv.2304.10628,
  title  = {HM-ViT: Hetero-modal Vehicle-to-Vehicle Cooperative perception with vision transformer},
  author = {Hao Xiang and Runsheng Xu and Jiaqi Ma},
  journal= {arXiv preprint arXiv:2304.10628},
  year   = {2023}
}