面向大规模强化学习的后验采样
机器学习
2018-10-24 v3 人工智能
摘要
我们提出了一种实用的非片段式 PSRL 算法,与近期最先进的 PSRL 算法不同,其采用确定性的、与模型无关的事件切换调度。我们称为确定性调度 PSRL(DS-PSRL)的该算法在时间、样本与空间复杂度方面均是高效的。我们在温和假设下证明了贝叶斯遗憾界。我们的结果更一般地适用于多参数与连续状态动作问题。我们在文献中的标准离散与连续问题上将我们的算法与最先进 PSRL 算法进行比较。最后,我们展示了我们的算法假设如何满足一大类序列推荐问题的合理参数化。
引用
@article{arxiv.1711.07979,
title = {Posterior Sampling for Large Scale Reinforcement Learning},
author = {Georgios Theocharous and Zheng Wen and Yasin Abbasi-Yadkori and Nikos Vlassis},
journal= {arXiv preprint arXiv:1711.07979},
year = {2018}
}