中文

从模仿到探索:基于世界模型的端到端自动驾驶

人工智能 2025-04-22 v2 机器学习 机器人学

摘要

近年来,基于模仿学习(Imitation Learning, IL)的端到端自动驾驶架构因其避免误差累积的优势而受到越来越多的关注。然而,IL往往难以处理训练数据集之外的场景,尤其是在高动态和交互密集的交通环境中。相比之下,基于强化学习(Reinforcement Learning, RL)的驾驶模型能够通过与环境交互优化驾驶决策,提高了适应性和鲁棒性。为此,我们提出RAMBLE,这是一种基于世界模型的端到端RL方法,用于驾驶决策。RAMBLE通过非对称变分自编码器从RGB图像和LiDAR数据中提取环境上下文信息。随后,采用基于Transformer的架构捕获交通参与者的动态转换。然后,应用演员-评论家结构的强化学习算法,基于当前状态和动态的潜在特征推导驾驶策略。为加快策略收敛并确保稳定训练,我们引入一种训练方案:首先使用IL初始化策略网络,然后采用KL损失和软更新机制平滑地将模型从IL过渡到RL。RAMBLE在CARLA Leaderboard 1.0上实现了最高的路径完成率,并在CARLA Leaderboard 2.0的全部38个场景中顺利完成,展示了其在处理复杂动态交通场景方面的有效性。该模型将在论文被接受后开源,地址为https://github.com/SCP-CN-001/ramble,以支持自动驾驶领域的进一步研究与开发。

关键词

引用

@article{arxiv.2410.02253,
  title  = {From Imitation to Exploration: End-to-end Autonomous Driving based on World Model},
  author = {Yueyuan Li and Mingyang Jiang and Songan Zhang and Wei Yuan and Chunxiang Wang and Ming Yang},
  journal= {arXiv preprint arXiv:2410.02253},
  year   = {2025}
}

备注

12 pages, 4 figures, 3 tables; T-ITS under review