关于线性函数逼近下SARSA的收敛性
机器学习
2023-05-16 v3
摘要
SARSA是强化学习中经典的on-policy控制算法,已知其与线性函数逼近结合时会产生抖动:SARSA不发散而是在有界区域内振荡。然而,关于SARSA收敛到该区域的速度以及该区域的大小,人们知之甚少。在本文中,我们针对这一开放问题取得进展,给出了投影SARSA收敛到有界区域的速率。重要的是,只要奖励的大小不是太大,该区域远小于我们所投影到的区域。现有关于线性SARSA收敛到不动点的工作都要求SARSA的策略改进算子的Lipschitz常数足够小;而我们的分析适用于任意Lipschitz常数,从而刻画了线性SARSA在新 regime 下的行为。
引用
@article{arxiv.2202.06828,
title = {On the Convergence of SARSA with Linear Function Approximation},
author = {Shangtong Zhang and Remi Tachet and Romain Laroche},
journal= {arXiv preprint arXiv:2202.06828},
year = {2023}
}
备注
ICML 2023