无幕次强化学习的后验采样
机器学习
2016-08-10 v1 机器学习
摘要
这是一篇简短的技术说明,旨在澄清在没有固定幕次的环境中应用后验采样强化学习(PSRL)算法时存在的一些问题。具体而言,本文旨在:- 回顾一些已针对有限视界 MDP(Osband 等人,2013, 2014a, 2014b, 2016)以及具有有限遍历结构的 MDP(Gopalan 等人,2014)证明的结果。- 回顾无限视界问题中乐观算法的类似结果(Jaksch 等人,2010, Bartlett 和 Tewari 2009, Abbasi-Yadkori 和 Szepesvari 2011),特别关注动态幕次增长。- 强调导致 lazy-PSRL 算法证明错误(Abbasi-Yadkori 和 Szepesvari 2015)的微妙技术问题。我们为此类论证提出了一个明确的反例。因此,我们建议将 (Abbasi-Yadkori 和 Szepesvari 2015) 中的定理 2 视为猜想,因为它缺乏严格的证明。- 提出在无限视界问题中应用 PSRL 的实用方法。我们猜想,在一些额外假设下,即使没有幕次重置,也有可能获得 的界。我们希望本说明有助于澄清强化学习领域的现有结果,并为未来的工作提供有趣的动机。
引用
@article{arxiv.1608.02731,
title = {Posterior Sampling for Reinforcement Learning Without Episodes},
author = {Ian Osband and Benjamin Van Roy},
journal= {arXiv preprint arXiv:1608.02731},
year = {2016}
}