中文

M2DA:面向自动驾驶的融合驾驶员注意力的多模态融合Transformer

计算机视觉与模式识别 2024-03-20 v1 人工智能 机器人学

摘要

端到端自动驾驶已取得显著进展。然而,自动驾驶车辆的大规模部署尚未实现,主要由于:1)低效的多模态环境感知:如何更高效地融合来自多模态传感器的数据;2)非类人的场景理解:如何像经验丰富的驾驶员一样,在交通场景中有效定位和预测关键危险智能体。为克服这些挑战,本文提出了一种面向自动驾驶的融合驾驶员注意力的多模态融合Transformer(M2DA)。为了更好地融合多模态数据并实现不同模态间更高的对齐度,我们提出了一种新颖的基于激光雷达-视觉-注意力的融合(LVAFusion)模块。通过融入驾驶员注意力,我们赋予自动驾驶车辆类人的场景理解能力,使其能够精确识别复杂场景中的关键区域并确保安全。我们在CARLA模拟器上进行了实验,在闭环基准测试中以更少的数据实现了最先进的性能。源代码可在https://anonymous.4open.science/r/M2DA-4772获取。

关键词

引用

@article{arxiv.2403.12552,
  title  = {M2DA: Multi-Modal Fusion Transformer Incorporating Driver Attention for Autonomous Driving},
  author = {Dongyang Xu and Haokun Li and Qingfan Wang and Ziying Song and Lei Chen and Hanming Deng},
  journal= {arXiv preprint arXiv:2403.12552},
  year   = {2024}
}