Q-learning 几乎必然收敛的初等证明
机器学习
2021-08-09 v1
摘要
Watkins 和 Dayan 的 Q-learning 是一种无模型强化学习算法,它通过随机“访问”许多状态-动作对来迭代地改进对 MDP 最优动作值函数的估计 [Watkins and Dayan, 1992]。该算法的变体处于众多近期强化学习最先进成就的核心,包括超人类水平的 Atari 游戏深度 Q 网络 [Mnih et al., 2015]。本文的目标是给出一个精确且(几乎)自包含的 Q-learning 收敛证明。现有大量文献利用强有力的理论来获得此类高度可推广的结果。然而,这种方法要求读者熟悉许多不同研究领域并与之建立深层联系。寻求加深对 Q-learning 理解的学生可能陷入“RL 学习地狱”的恶性循环。为此,我们仅使用随机逼近领域的一个外部结果,从头到尾给出完整证明,尽管这种对其他结果的最小依赖是以损失某些“光鲜性”为代价的。
引用
@article{arxiv.2108.02827,
title = {An Elementary Proof that Q-learning Converges Almost Surely},
author = {Matthew T. Regehr and Alex Ayoub},
journal= {arXiv preprint arXiv:2108.02827},
year = {2021}
}