DiffusionDriveV2:端到端自动驾驶中强化学习约束的截断扩散建模
计算机视觉与模式识别
2025-12-09 v1
摘要
用于端到端自动驾驶的生成式扩散模型常遭受模式坍塌,倾向于生成保守且同质化的行为。尽管 DiffusionDrive 利用代表不同驾驶意图的预定义锚点来划分动作空间并生成多样化轨迹,但其对模仿学习的依赖缺乏足够的约束,导致多样性与持续高质量之间陷入两难。本文提出 DiffusionDriveV2,利用强化学习来约束低质量模式并探索更优轨迹。这显著提升了整体输出质量,同时保留了其核心高斯混合模型固有的多模态特性。首先,我们使用非常适合轨迹规划的尺度自适应乘性噪声来促进广泛探索。其次,我们采用锚内 GRPO 来管理从单个锚点生成的样本间的优势估计,并采用锚间截断 GRPO 来整合跨不同锚点的全局视角,防止不同意图(例如,转弯与直行)之间进行不恰当的优势比较,这可能导致进一步模式坍塌。DiffusionDriveV2 在对齐的 ResNet-34 骨干网络下,于 NAVSIM v1 数据集上取得了 91.2 PDMS,在 NAVSIM v2 数据集的闭环评估中取得了 85.5 EPDMS,创下新纪录。进一步实验验证了我们的方法解决了截断扩散模型在多样性与最优高质量之间的两难问题,实现了最佳权衡。代码和模型将发布于 https://github.com/hustvl/DiffusionDriveV2。
引用
@article{arxiv.2512.07745,
title = {DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving},
author = {Jialv Zou and Shaoyu Chen and Bencheng Liao and Zhiyu Zheng and Yuehao Song and Lefei Zhang and Qian Zhang and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2512.07745},
year = {2025}
}