无需昂贵模块化与3D人工标注的端到端自动驾驶
计算机视觉与模式识别
2024-06-26 v1
摘要
我们提出UAD,一种基于视觉的端到端自动驾驶(E2EAD)方法,在nuScenes上取得了最佳的开环评估性能,同时在CARLA中展现出鲁棒的闭环驾驶质量。我们的动机源于观察到当前的E2EAD模型仍然模仿典型驾驶栈中的模块化架构,通过精心设计的有监督感知和预测子任务来为面向规划的模块提供环境信息。尽管取得了突破性进展,但这种设计存在某些缺陷:1)前置子任务需要大量高质量的3D标注作为监督,严重阻碍了训练数据的扩展;2)每个子模块在训练和推理中都会产生大量的计算开销。为此,我们提出UAD,一种带有无监督代理的E2EAD框架来解决所有这些问题。首先,我们设计了一种新颖的角向感知预文(Angular Perception Pretext)来消除标注需求。该预文通过预测角向空间目标性和时间动态来对驾驶场景建模,无需人工标注。其次,提出了一种自监督训练策略,该策略学习不同增强视角下预测轨迹的一致性,以增强转向场景中的规划鲁棒性。我们的UAD在nuScenes的平均碰撞率上比UniAD相对提升了38.7%,并在CARLA的Town05 Long基准测试中,驾驶得分上超越了VAD 41.32分。此外,所提方法仅消耗UniAD 44.3%的训练资源,推理速度快3.4倍。我们的创新设计不仅首次展示了相对于有监督方法无可争议的性能优势,而且在数据、训练和推理方面享有前所未有的效率。代码和模型将在https://github.com/KargoBot_Research/UAD发布。
引用
@article{arxiv.2406.17680,
title = {End-to-End Autonomous Driving without Costly Modularization and 3D Manual Annotation},
author = {Mingzhe Guo and Zhipeng Zhang and Yuan He and Ke Wang and Liping Jing},
journal= {arXiv preprint arXiv:2406.17680},
year = {2024}
}
备注
17 pages, 10 figures and 15 tables