HAD:基于层次扩散与度量解耦强化学习的端到端驾驶
机器人学
2026-04-07 v1 计算机视觉与模式识别
摘要
端到端规划已成为自动驾驶的主导范式,近期模型常采用评分-选择框架从大量候选轨迹中选择轨迹,扩散解码展现出强大潜力。然而,直接从整个候选空间中选择仍难以优化,常用的高斯扰动会引入不现实的轨迹, complicating 去噪过程。此外,针对训练,这些模型通常依赖单一耦合奖励,缺乏结构化信号,限制优化效果。为此,我们提出 HAD,一种基于层次扩散策略的端到端规划框架,将规划分解为粗到细的过程。为改进轨迹生成,我们引入保持结构的轨迹扩张,产生现实可接受的候选方案,同时保持运动学结构。对于策略学习,我们开发了度量解耦策略优化 (MDPO),实现跨多个驾驶目标的结构化强化学习优化。大量实验表明,HAD 在 NAVSIM 和 HUGSIM 上均实现了新的最佳性能:NAVSIM 上 EPDMS 提升 ,HUGSIM 上路径完成率提升 。
引用
@article{arxiv.2604.03581,
title = {HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving},
author = {Wenhao Yao and Xinglong Sun and Zhenxin Li and Shiyi Lan and Zi Wang and Jose M. Alvarez and Zuxuan Wu},
journal= {arXiv preprint arXiv:2604.03581},
year = {2026}
}
备注
17 pages, 7 figures