DriveTransformer:用于可扩展端到端自动驾驶的统一Transformer
机器学习
2025-07-14 v2 计算机视觉与模式识别
机器人学
摘要
端到端自动驾驶(E2E-AD)已成为自动驾驶领域的一个趋势,承诺提供一种数据驱动、可扩展的系统设计方法。然而,现有的E2E-AD方法通常采用感知-预测-规划的顺序范式,这会导致累积误差和训练不稳定。任务的手动排序也限制了系统利用任务之间协同作用的能力(例如,感知感知的规划和博弈论交互式预测与规划)。此外,现有方法采用的密集BEV表示为远距离感知和长期时间融合带来了计算挑战。为解决这些挑战,我们提出了DriveTransformer,一个简化的E2E-AD框架,易于扩展,其三个关键特征为:任务并行性(所有智能体、地图和规划查询在每个模块中直接交互)、稀疏表示(任务查询直接与原始传感器特征交互)和流式处理(任务查询被存储并作为历史信息传递)。因此,新框架由三个统一操作组成:任务自注意力、传感器交叉注意力和时间交叉注意力,这显著降低了系统复杂性并带来了更好的训练稳定性。DriveTransformer在模拟闭环基准Bench2Drive和真实世界开环基准nuScenes上均取得了最先进性能,且具有高帧率。
引用
@article{arxiv.2503.07656,
title = {DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving},
author = {Xiaosong Jia and Junqi You and Zhiyuan Zhang and Junchi Yan},
journal= {arXiv preprint arXiv:2503.07656},
year = {2025}
}
备注
Accepted by ICLR2025; Fix Typo