中文

离线强化学习中 Actor-Critic 方法的可证明收益

机器学习 2021-08-20 v1

摘要

Actor-critic 方法在离线强化学习实践中被广泛使用,但在理论上尚不被充分理解。我们提出了一种新的离线 actor-critic 算法,其自然地融入了悲观原则,相较于现有最优方法带来了若干关键优势。该算法可在 Bellman 评估算子关于 actor 策略的动作值函数封闭时运行;这是比低秩 MDP 模型更一般的设定。尽管增加了一般性,该过程在计算上仍是易处理的,因为它涉及求解一系列二阶规划。我们证明了该过程所返回策略的次优性差距的上界,该上界依赖于任意可能的、甚至数据依赖的比较策略的数据覆盖度。所达成的保证由一个极小极大下界补充,其在对数因子内是匹配的。

关键词

引用

@article{arxiv.2108.08812,
  title  = {Provable Benefits of Actor-Critic Methods for Offline Reinforcement Learning},
  author = {Andrea Zanette and Martin J. Wainwright and Emma Brunskill},
  journal= {arXiv preprint arXiv:2108.08812},
  year   = {2021}
}

备注

Initial submission; appeared as spotlight talk in ICML 2021 Workshop on Theory of RL