中文

基于模型的闭环端到端自动驾驶策略适应

机器人学 2025-11-27 v1 人工智能

摘要

端到端(E2E)自动驾驶模型在开环评估中表现出色,但在闭环环境中常因错误级联和泛化能力差而受限。为解决这一问题,我们提出了基于模型的策略适应(Model-based Policy Adaptation, MPA)框架,以提升预训练E2E驾驶智能体在部署时的鲁棒性和安全性。MPA首先利用几何一致的仿真引擎生成多样化的反事实轨迹,使智能体暴露于原始数据集之外的场景。基于生成数据,MPA训练基于扩散模型的策略适配器以细化基础策略的预测,并训练多步骤Q值模型以评估长期结果。在推理阶段,适配器提出多个轨迹候选方案,Q值模型选择预期效用最高的轨迹。在nuScenes基准测试中使用逼真的闭环仿真器进行实验,结果表明MPA在域内、域外及安全关键场景中均显著提升性能。我们进一步探讨了反事实数据的规模及推理时指导策略对整体效果的影响。

关键词

引用

@article{arxiv.2511.21584,
  title  = {Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving},
  author = {Haohong Lin and Yunzhi Zhang and Wenhao Ding and Jiajun Wu and Ding Zhao},
  journal= {arXiv preprint arXiv:2511.21584},
  year   = {2025}
}

备注

Published at NeurIPS 2025: https://openreview.net/forum?id=4OLbpaTKJe