M2DA:面向自动驾驶的融合驾驶员注意力的多模态融合Transformer
计算机视觉与模式识别
2024-03-20 v1 人工智能
机器人学
摘要
端到端自动驾驶已取得显著进展。然而,自动驾驶车辆的大规模部署尚未实现,主要由于:1)低效的多模态环境感知:如何更高效地融合来自多模态传感器的数据;2)非类人的场景理解:如何像经验丰富的驾驶员一样,在交通场景中有效定位和预测关键危险智能体。为克服这些挑战,本文提出了一种面向自动驾驶的融合驾驶员注意力的多模态融合Transformer(M2DA)。为了更好地融合多模态数据并实现不同模态间更高的对齐度,我们提出了一种新颖的基于激光雷达-视觉-注意力的融合(LVAFusion)模块。通过融入驾驶员注意力,我们赋予自动驾驶车辆类人的场景理解能力,使其能够精确识别复杂场景中的关键区域并确保安全。我们在CARLA模拟器上进行了实验,在闭环基准测试中以更少的数据实现了最先进的性能。源代码可在https://anonymous.4open.science/r/M2DA-4772获取。
引用
@article{arxiv.2403.12552,
title = {M2DA: Multi-Modal Fusion Transformer Incorporating Driver Attention for Autonomous Driving},
author = {Dongyang Xu and Haokun Li and Qingfan Wang and Ziying Song and Lei Chen and Hanming Deng},
journal= {arXiv preprint arXiv:2403.12552},
year = {2024}
}