中文

潜在世界模型中面向自动驾驶的协作-竞争模仿-强化学习 (CoIRL-AD)

计算机视觉与模式识别 2025-10-15 v1 机器学习 机器人学

摘要

仅使用模仿学习 (IL) 训练的端到端自动驾驶模型常面临泛化能力差的问题。相比之下,强化学习 (RL) 通过奖励最大化促进探索,但面临样本效率低和收敛不稳定等挑战。一种自然的解决方案是将 IL 和 RL 结合。超越常规的两阶段范式(IL 预训练后 RL 微调),我们提出 CoIRL-AD,一种竞争性双策略框架,使 IL 和 RL 智能体在训练期间能够相互交互。CoIRL-AD 引入一种基于竞争的机制,促进知识交换,同时防止梯度冲突。在 nuScenes 数据集上的实验表明,CoIRL-AD 碰撞率比基线方法降低了18%,同时在长尾情境中表现出更强的泛化能力和更好的性能。代码已公开:https://github.com/SEU-zxj/CoIRL-AD。

关键词

引用

@article{arxiv.2510.12560,
  title  = {CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving},
  author = {Xiaoji Zheng and Ziyuan Yang and Yanhao Chen and Yuhang Peng and Yuanrong Tang and Gengyuan Liu and Bokui Chen and Jiangtao Gong},
  journal= {arXiv preprint arXiv:2510.12560},
  year   = {2025}
}

备注

18 pages, 17 figures