异步Q学习与TD学习变体有限样本保证的李雅普诺夫理论
机器学习
2023-09-06 v4 最优化与控制
机器学习
摘要
本文发展了一个统一框架,用于研究一大类基于价值的异步强化学习(RL)算法的有限样本收敛保证。为此,我们首先将 RL 算法重新表述为求解不动点方程的\textit{马尔可夫随机逼近}(SA)算法。随后我们发展了李雅普诺夫分析,并推导了马尔可夫 SA 收敛的均方误差界。基于此结果,我们建立了异步 RL 算法(如 -学习、 步 TD、TD,以及包括 V-trace 在内的离策略 TD 算法)的有限样本均方收敛界。作为副产品,通过分析 步 TD 与 TD 的收敛界,我们提供了关于偏差-方差权衡(即 RL 中自举的效率)的理论见解。这最初在 (Sutton, 1999) 中作为一个开放问题被提出。
引用
@article{arxiv.2102.01567,
title = {A Lyapunov Theory for Finite-Sample Guarantees of Asynchronous Q-Learning and TD-Learning Variants},
author = {Zaiwei Chen and Siva Theja Maguluri and Sanjay Shakkottai and Karthikeyan Shanmugam},
journal= {arXiv preprint arXiv:2102.01567},
year = {2023}
}