用于端到端自动驾驶的多模态融合Transformer
计算机视觉与模式识别
2021-04-20 v1 人工智能
机器学习
机器人学
摘要
应如何整合来自互补传感器的表征以用于自动驾驶?基于几何的传感器融合在目标检测和运动预测等感知任务中已展现出巨大前景。然而,对于实际的驾驶任务,3D场景的全局上下文是关键,例如交通灯状态的变化会影响在几何上远离该交通灯的车辆的行为。因此,仅依靠几何可能不足以在端到端驾驶模型中有效融合表征。在本文中,我们证明了基于现有传感器融合方法的模仿学习策略在动态智能体高密度和复杂场景(需要全局上下文推理,例如在无控制交叉口处理来自多个方向的来车)下表现不佳。因此,我们提出TransFuser,一种新颖的多模态融合Transformer,利用注意力整合图像和LiDAR表征。我们使用CARLA城市驾驶模拟器在涉及复杂场景的城市环境中实验验证了我们的方法的有效性。我们的方法实现了最先进的驾驶性能,同时与基于几何的融合相比将碰撞减少了76%。
引用
@article{arxiv.2104.09224,
title = {Multi-Modal Fusion Transformer for End-to-End Autonomous Driving},
author = {Aditya Prakash and Kashyap Chitta and Andreas Geiger},
journal= {arXiv preprint arXiv:2104.09224},
year = {2021}
}
备注
CVPR 2021