DriveDPO:通过安全DPO进行策略学习以实现端到端自动驾驶
机器人学
2025-09-23 v1 计算机视觉与模式识别
摘要
端到端自动驾驶通过直接从原始感知输入预测未来轨迹取得了实质性进展,从而绕过了传统的模块化流水线。然而,通过模仿学习训练的主流方法存在严重的安全局限性,因为它们无法区分看似类人但可能不安全的轨迹。一些近期方法试图通过回归多个基于规则的评分来解决此问题,但将监督与策略优化解耦,导致性能次优。为了应对这些挑战,我们提出了 DriveDPO,一个安全直接偏好优化策略学习框架。首先,我们从人类模仿相似性和基于规则的安全评分中蒸馏出统一的策略分布,用于直接策略优化。进一步,我们引入了一个迭代直接偏好优化阶段,表述为轨迹级偏好对齐。在 NAVSIM 基准上的大量实验表明,DriveDPO 达到了新的最先进 PDMS 值 90.0。此外,在各种具有挑战性的场景中的定性结果突显了 DriveDPO 产生更安全、更可靠驾驶行为的能力。
引用
@article{arxiv.2509.17940,
title = {DriveDPO: Policy Learning via Safety DPO For End-to-End Autonomous Driving},
author = {Shuyao Shang and Yuntao Chen and Yuqi Wang and Yingyan Li and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:2509.17940},
year = {2025}
}
备注
NeurIPS 2025