中文

自动驾驶强化学习中奖励函数的设计

机器人学 2025-03-24 v1

摘要

本文提出了一种奖励函数设计方案,用于在自动驾驶中应用强化学习时持续评估驾驶状态和动作。在强化学习领域,奖励函数通常通过赋予+1表示成功、-1表示失败等值来评估目标是否达成。此类奖励函数可能获得达成目标的策略,但目标达成的过程本身未被评估。然而,对于自动驾驶而言,到达目的地的过程至关重要,例如保持车速、规避风险、保持与其他车辆的距离以及为乘客提供舒适体验。因此,本方案设计的奖励函数通过评估驾驶过程来适配自动驾驶需求。该方案的效果在模拟环路驾驶和高速公路巡航场景中得到了验证。采用Asynchronous Advantage Actor-Critic算法进行训练,模型在多种情境下进行训练以获得泛化能力。结果表明,可以获得适当的驾驶位置,例如在弯道内侧行驶以及沿急弯快速减速。在高速公路巡航中,自车能够在有其他车辆的环境中变道,通过适当减速避免追上前车,同时通过加速防止后车追尾自车。

关键词

引用

@article{arxiv.2503.16559,
  title  = {Design of Reward Function on Reinforcement Learning for Automated Driving},
  author = {Takeru Goto and Yuki Kizumi and Shun Iwasaki},
  journal= {arXiv preprint arXiv:2503.16559},
  year   = {2025}
}

备注

Accepted in IFAC World Congress 2023, 6 pages, 9 figures