潜在世界模型中面向自动驾驶的协作-竞争模仿-强化学习 (CoIRL-AD)
计算机视觉与模式识别
2025-10-15 v1 机器学习
机器人学
摘要
仅使用模仿学习 (IL) 训练的端到端自动驾驶模型常面临泛化能力差的问题。相比之下,强化学习 (RL) 通过奖励最大化促进探索,但面临样本效率低和收敛不稳定等挑战。一种自然的解决方案是将 IL 和 RL 结合。超越常规的两阶段范式(IL 预训练后 RL 微调),我们提出 CoIRL-AD,一种竞争性双策略框架,使 IL 和 RL 智能体在训练期间能够相互交互。CoIRL-AD 引入一种基于竞争的机制,促进知识交换,同时防止梯度冲突。在 nuScenes 数据集上的实验表明,CoIRL-AD 碰撞率比基线方法降低了18%,同时在长尾情境中表现出更强的泛化能力和更好的性能。代码已公开:https://github.com/SEU-zxj/CoIRL-AD。
引用
@article{arxiv.2510.12560,
title = {CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving},
author = {Xiaoji Zheng and Ziyuan Yang and Yanhao Chen and Yuhang Peng and Yuanrong Tang and Gengyuan Liu and Bokui Chen and Jiangtao Gong},
journal= {arXiv preprint arXiv:2510.12560},
year = {2025}
}
备注
18 pages, 17 figures