基于通用值函数逼近的强化学习:通过有界 eluder 维的可证明高效方法
机器学习
2020-06-22 v3 最优化与控制
机器学习
摘要
值函数逼近在强化学习(RL)中已展现出惊人的经验成功。然而,尽管近期在建立线性函数逼近 RL 理论方面取得了一些进展,对通用函数逼近方案的理解在很大程度上仍然缺失。在本文中,我们建立了一种基于通用值函数逼近的可证明高效的 RL 算法。我们表明,若值函数可用函数类 进行逼近,则我们的算法达到 的悔界,其中 是 的复杂度度量,依赖于 eluder 维 [Russo and Van Roy, 2013] 与对数覆盖数, 是规划时域, 是与环境的交互次数。我们的理论推广了近期关于线性值函数逼近 RL 的进展,且不对环境模型作显式假设。此外,我们的算法是无模型的,并提供了一个框架以论证实践中所用算法的有效性。
引用
@article{arxiv.2005.10804,
title = {Reinforcement Learning with General Value Function Approximation: Provably Efficient Approach via Bounded Eluder Dimension},
author = {Ruosong Wang and Ruslan Salakhutdinov and Lin F. Yang},
journal= {arXiv preprint arXiv:2005.10804},
year = {2020}
}