中文

自动驾驶中强化学习的行动空间缩减策略

机器人学 2025-07-08 v1 人工智能

摘要

强化学习(RL)为自动驾驶提供了有前景的框架,通过与环境互动使智能体学习控制策略。然而,常用于支持细粒度控制的大尺寸高维行动空间会阻碍训练效率并增加探索成本。本研究引入并评估了两种新颖的结构化行动空间修改策略,用于自动驾驶中的RL:动态掩码和相对行动空间缩减。这些方法系统地与固定缩减方案和完整行动空间基线进行比较,以评估其对策略学习和性能的影响。我们的框架利用多模态近端策略优化智能体处理语义图像序列和标量车辆状态。所提出的动态和相对策略基于上下文和状态转换的实时行动掩码,既保留行动一致性,又消除无效或次优选择。通过在多样化驾驶路线上的全面实验,我们表明行动空间缩减显著改善了训练稳定性和策略性能。特别是,动态和相对方案在学习速度、控制精度和泛化之间取得了良好平衡。这些发现凸显了面向可扩展和可靠RL在自动驾驶任务中,上下文感知的行动空间设计的重要性。

关键词

引用

@article{arxiv.2507.05251,
  title  = {Action Space Reduction Strategies for Reinforcement Learning in Autonomous Driving},
  author = {Elahe Delavari and Feeza Khan Khanzada and Jaerock Kwon},
  journal= {arXiv preprint arXiv:2507.05251},
  year   = {2025}
}