中文

为什么后验采样在强化学习中优于乐观主义?

机器学习 2017-06-14 v3 人工智能 机器学习

摘要

计算结果表明,用于强化学习的后验采样(PSRL)显著优于由乐观主义驱动的算法,如 UCRL2。我们深入分析了这种性能提升的程度及其驱动因素。利用这一洞察,我们在有限时域情景马尔可夫决策过程中为 PSRL 建立了一个 O~(HSAT)\tilde{O}(H\sqrt{SAT}) 的贝叶斯期望遗憾界,其中 HH 是时域长度,SS 是状态数,AA 是动作数,TT 是经过的时间。这优于任何强化学习算法先前的最佳界 O~(HSAT)\tilde{O}(H S \sqrt{AT})

关键词

引用

@article{arxiv.1607.00215,
  title  = {Why is Posterior Sampling Better than Optimism for Reinforcement Learning?},
  author = {Ian Osband and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:1607.00215},
  year   = {2017}
}