中文

DRARL:基于不满意原因增强的强化学习用于提升自动驾驶策略

机器人学 2025-06-23 v1 机器学习

摘要

随着自动驾驶车辆在开放道路上受监控行驶的日益增多,不满足情况也日益频繁。虽然一些数据驱动的规划系统试图直接利用这些不满意情况以改进策略,但不足的数据稀缺性(往往仅出现一次)限制了训练效果。此外,有些不满意数据应被排除,因为不满意并不总是源于驾驶策略的失效,例如驾驶员可能随意介入。为此,本文提出了不满意原因增强强化学习(DRARL),根据不满意的原因增强驾驶策略的改进过程。具体而言,通过一种异常分布(OOD)状态估计模型识别不满意的原因。当原因不存在时,该案例将被识别为非正式的不满意情况,不需要额外的策略调整。否则,策略将在基于原因增强的想象环境中进行更新,通过原因增强训练来提高类似原因的不满意情况的策略性能。该方法使用自动驾驶 robotaxi 收集的真实世界不满意案例进行评估。实验结果表明,该方法准确识别了与策略相关的不满意原因,使智能体能够通过原因增强训练处理原始情况及语义相似情况。此外,该方法防止了在策略调整后智能体过于保守。总体而言,本工作提供了一种高效的改进驾驶策略性能的方法。

关键词

引用

@article{arxiv.2506.16720,
  title  = {DRARL: Disengagement-Reason-Augmented Reinforcement Learning for Efficient Improvement of Autonomous Driving Policy},
  author = {Weitao Zhou and Bo Zhang and Zhong Cao and Xiang Li and Qian Cheng and Chunyang Liu and Yaqin Zhang and Diange Yang},
  journal= {arXiv preprint arXiv:2506.16720},
  year   = {2025}
}