LeTFuser: 基于轻量级端到端Transformer的多任务自动驾驶传感器融合
计算机视觉与模式识别
2023-12-05 v3
摘要
在端到端自动驾驶中,现有传感器融合技术与导航控制方法在涉及众多动态智能体的挑战性情境下用于模仿学习时显得不足。为解决该问题,我们提出LeTFuser,一种用于融合多路RGB-D相机表示的轻量级基于Transformer的算法。为同时执行感知与控制任务,我们采用多任务学习。我们的模型包含两个模块,其一是感知模块,负责编码从RGB-D相机获得的观测数据。我们的方法采用卷积视觉Transformer(CvT) \cite{wu2021cvt}以更好地从多路RGB相机提取并融合特征,这得益于卷积与Transformer模块分别具有的局部与全局特征提取能力。编码特征结合静态与动态环境后由我们的控制模块用于预测航点与车辆控制(如转向、油门与制动)。我们使用两种方法生成车辆控制层级。第一种方法使用PID算法实时跟随航点,第二种则利用测量特征与环境状态直接预测控制策略。我们在CARLA模拟器上以从正常到对抗条件的多种场景评估模型并与近期模型进行对比分析,以模拟真实世界场景。我们的方法在驾驶能力方面展现出相对于基线更优或相当的结果。代码已发布于\url{https://github.com/pagand/e2etransfuser/tree/cvpr-w}以促进后续研究。
引用
@article{arxiv.2310.13135,
title = {LeTFuser: Light-weight End-to-end Transformer-Based Sensor Fusion for Autonomous Driving with Multi-Task Learning},
author = {Pedram Agand and Mohammad Mahdavian and Manolis Savva and Mo Chen},
journal= {arXiv preprint arXiv:2310.13135},
year = {2023}
}
备注
11 pages, 2 figures, 3 tables. CVPR Workshops (VCAD). 2023