中文

异步Q学习与TD学习变体有限样本保证的李雅普诺夫理论

机器学习 2023-09-06 v4 最优化与控制 机器学习

摘要

本文发展了一个统一框架,用于研究一大类基于价值的异步强化学习(RL)算法的有限样本收敛保证。为此,我们首先将 RL 算法重新表述为求解不动点方程的\textit{马尔可夫随机逼近}(SA)算法。随后我们发展了李雅普诺夫分析,并推导了马尔可夫 SA 收敛的均方误差界。基于此结果,我们建立了异步 RL 算法(如 QQ-学习、nn 步 TD、TD(λ)(\lambda),以及包括 V-trace 在内的离策略 TD 算法)的有限样本均方收敛界。作为副产品,通过分析 nn 步 TD 与 TD(λ)(\lambda) 的收敛界,我们提供了关于偏差-方差权衡(即 RL 中自举的效率)的理论见解。这最初在 (Sutton, 1999) 中作为一个开放问题被提出。

关键词

引用

@article{arxiv.2102.01567,
  title  = {A Lyapunov Theory for Finite-Sample Guarantees of Asynchronous Q-Learning and TD-Learning Variants},
  author = {Zaiwei Chen and Siva Theja Maguluri and Sanjay Shakkottai and Karthikeyan Shanmugam},
  journal= {arXiv preprint arXiv:2102.01567},
  year   = {2023}
}