中文

具有二次型奖励的强化学习的稳态误差补偿

系统与控制 2024-04-02 v2 机器学习 系统与控制

摘要

强化学习(RL)中奖励函数的选择因其对系统性能的影响而备受关注。当采用二次型奖励函数时,常常会出现显著的稳态误差问题。尽管绝对值型奖励函数缓解了这个问题,但它们往往会在特定系统状态中引起大幅波动,导致突变。为应对这一挑战,本研究提出了一种引入积分项的方法。通过将此积分项集成到二次型奖励函数中,RL算法得到巧妙调整,增强了系统对奖励历史的考量,从而缓解了与稳态误差相关的问题。通过在自适应巡航控制(ACC)和变道模型上的实验与性能评估,我们验证了所提出的方法能有效减小稳态误差,并且不会在某些系统状态中引起显著的尖峰。

引用

@article{arxiv.2402.09075,
  title  = {Steady-State Error Compensation for Reinforcement Learning with Quadratic Rewards},
  author = {Liyao Wang and Zishun Zheng and Yuan Lin},
  journal= {arXiv preprint arXiv:2402.09075},
  year   = {2024}
}