中文

基于策略的平均奖励强化学习算法的性能界

机器学习 2023-06-29 v3 系统与控制 系统与控制

摘要

许多基于策略的强化学习(RL)算法可视为近似策略迭代(PI)的实例化,即策略改进与策略评估均被近似执行。在以平均奖励目标作为有意义性能度量的应用中,常使用折扣因子接近1,1,的折扣奖励公式,这等价于使期望时域非常大。然而,相应的误差性能理论界随时域的平方而缩放。因此,即便将总奖励除以时域长度,平均奖励问题的相应性能界仍趋于无穷。因此,一个开放问题是为平均奖励设定下的近似PI与RL算法获得有意义的性能界。本文通过获得平均奖励MDP的首个有限时间误差界解决了该开放问题,并表明当策略评估误差与策略改进误差趋于零时,渐近误差也趋于零。

关键词

引用

@article{arxiv.2302.01450,
  title  = {Performance Bounds for Policy-Based Average Reward Reinforcement Learning Algorithms},
  author = {Yashaswini Murthy and Mehrdad Moharrami and R. Srikant},
  journal= {arXiv preprint arXiv:2302.01450},
  year   = {2023}
}

备注

24 pages