为什么后验采样在强化学习中优于乐观主义?
机器学习
2017-06-14 v3 人工智能
机器学习
摘要
计算结果表明,用于强化学习的后验采样(PSRL)显著优于由乐观主义驱动的算法,如 UCRL2。我们深入分析了这种性能提升的程度及其驱动因素。利用这一洞察,我们在有限时域情景马尔可夫决策过程中为 PSRL 建立了一个 的贝叶斯期望遗憾界,其中 是时域长度, 是状态数, 是动作数, 是经过的时间。这优于任何强化学习算法先前的最佳界 。
引用
@article{arxiv.1607.00215,
title = {Why is Posterior Sampling Better than Optimism for Reinforcement Learning?},
author = {Ian Osband and Benjamin Van Roy},
journal= {arXiv preprint arXiv:1607.00215},
year = {2017}
}