中文

DeFIX:基于强化学习检测与修复模仿学习自动驾驶中的失效场景

机器人学 2025-07-21 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在无交通违规的前提下安全穿越城市环境是可靠自动驾驶的关键性能目标。本文提出一种基于强化学习(RL)的方法,用于检测并修复(DeFIX)模仿学习(IL)智能体的失效:提取违规点并在这些违规区域重构迷你场景,以训练 RL 智能体弥补 IL 方法的不足。DeFIX 是一个持续学习框架,其中失效场景提取与 RL 智能体训练在无限循环中执行。每训练出一个新策略并加入策略库后,一种策略分类方法会在评估时每一步有效决定激活哪一策略。结果表明,即便仅用一个在 IL 智能体失效场景上训练的 RL 智能体,DeFIX 方法也具竞争力或优于当前最优的基于 IL 与 RL 的城市自动驾驶基准。我们在 CARLA 仿真器最具挑战性的地图(Town05)上训练并验证了该方法,该地图包含复杂、真实且对抗性的驾驶场景。源代码公开于 https://github.com/data-and-decision-lab/DeFIX

关键词

引用

@article{arxiv.2210.16567,
  title  = {DeFIX: Detecting and Fixing Failure Scenarios with Reinforcement Learning in Imitation Learning Based Autonomous Driving},
  author = {Resul Dagdanov and Feyza Eksen and Halil Durmus and Ferhat Yurdakul and Nazim Kemal Ure},
  journal= {arXiv preprint arXiv:2210.16567},
  year   = {2025}
}

备注

6 pages, 4 figures, 2 tables, published in IEEE International Conference on Intelligent Transportation Systems (ITSC), October 12, 2022, Macau, China