目标网络与截断克服 Q-学习中的致命三元组
机器学习
2022-05-04 v2 最优化与控制
机器学习
摘要
带函数逼近的 Q-学习是最具经验成功却又在理论上最神秘的强化学习(RL)算法之一,并被 Sutton(1999)认定为 RL 领域最重要的理论开放问题之一。即使在基本的线性函数逼近设定下,也存在众所周知的发散例子。在本工作中,我们证明目标网络(target network)与截断(truncation)二者结合足以可证明地稳定带线性函数逼近的 Q-学习,并建立了有限样本保证。该结果意味着达到函数逼近误差级别的 O(ε^{-2}) 样本复杂度。此外,我们的结果不需要像现有文献那样做强假设或修改问题参数。
引用
@article{arxiv.2203.02628,
title = {Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning},
author = {Zaiwei Chen and John Paul Clarke and Siva Theja Maguluri},
journal= {arXiv preprint arXiv:2203.02628},
year = {2022}
}