TakeAD:基于专家接管数据的偏好式后优化端到端自动驾驶
机器人学
2025-12-23 v2 人工智能
摘要
现有的端到端自动驾驶方法通常依赖模仿学习 (IL),但面临一个关键挑战:开环训练与闭环部署之间的对齐问题。这种对齐问题常在闭环执行期间触发驾驶员发起的接管和系统不服从。在本文中,我们提出了TakeAD,一个新颖的偏好式后优化框架,通过这些不服从场景中的专家接管数据来增强闭环驾驶性能。首先,我们设计了一个受现实自动驾驶系统中人类接管机制启发的高效专家接管数据收集管道。随后,这个后优化框架集成了用于模仿学习的迭代数据聚合 (DAgger) 与用于偏好对齐的直接偏好优化 (DPO)。DAgger阶段通过直接模仿专家干预,为策略提供处理不服从状态的基本能力。后续,DPO阶段则细化策略在不服从场景中的行为,使之更好地符合专家偏好。经过多次迭代,策略逐步学习处理不服从状态的恢复策略,从而减缓开环差距。实验在闭环Bench2Drive基准测试上表明,我们的方法在与纯粹IL方法的比较中效果显著,综合消融实验确认了每个组件的贡献。
引用
@article{arxiv.2512.17370,
title = {TakeAD: Preference-based Post-optimization for End-to-end Autonomous Driving with Expert Takeover Data},
author = {Deqing Liu and Yinfeng Gao and Deheng Qian and Qichao Zhang and Xiaoqing Ye and Junyu Han and Yupeng Zheng and Xueyi Liu and Zhongpu Xia and Dawei Ding and Yifeng Pan and Dongbin Zhao},
journal= {arXiv preprint arXiv:2512.17370},
year = {2025}
}
备注
This work has been accepted by IEEE RA-L. Manuscript submitted: July, 8, 2025; Accepted: November, 24, 2025