中文

基于通用值函数逼近的强化学习:通过有界 eluder 维的可证明高效方法

机器学习 2020-06-22 v3 最优化与控制 机器学习

摘要

值函数逼近在强化学习(RL)中已展现出惊人的经验成功。然而,尽管近期在建立线性函数逼近 RL 理论方面取得了一些进展,对通用函数逼近方案的理解在很大程度上仍然缺失。在本文中,我们建立了一种基于通用值函数逼近的可证明高效的 RL 算法。我们表明,若值函数可用函数类 F\mathcal{F} 进行逼近,则我们的算法达到 O~(poly(dH)T)\widetilde{O}(\mathrm{poly}(dH)\sqrt{T}) 的悔界,其中 ddF\mathcal{F} 的复杂度度量,依赖于 eluder 维 [Russo and Van Roy, 2013] 与对数覆盖数,HH 是规划时域,TT 是与环境的交互次数。我们的理论推广了近期关于线性值函数逼近 RL 的进展,且不对环境模型作显式假设。此外,我们的算法是无模型的,并提供了一个框架以论证实践中所用算法的有效性。

关键词

引用

@article{arxiv.2005.10804,
  title  = {Reinforcement Learning with General Value Function Approximation: Provably Efficient Approach via Bounded Eluder Dimension},
  author = {Ruosong Wang and Ruslan Salakhutdinov and Lin F. Yang},
  journal= {arXiv preprint arXiv:2005.10804},
  year   = {2020}
}