收紧 Upper Confidence 强化学习中的探索
机器学习
2021-04-14 v3 系统与控制
系统与控制
机器学习
摘要
在(Jaksch et al., 2010)中引入的 upper confidence 强化学习(UCRL2)算法是在平均奖励准则下于未知离散 Markov Decision Process 中进行遗憾最小化的一种流行方法。尽管具有良好且通用的理论遗憾保证,该算法及其变体至今主要停留在理论层面,因为在简单环境中的数值实验表明,在学习发生之前会经历漫长的预热阶段。为了追求实际效率,我们沿着 UCRL2 的思路提出了 UCRL3,但进行了两项关键修改:首先,它使用最先进的时间一致集中不等式来计算每个状态-动作对的奖励和(逐分量的)转移分布的置信集。此外,为了收紧探索,它对每个转移分布的支撑集进行自适应计算,这反过来使我们能够重新审视 UCRL2 的扩展值迭代过程,通过忽略低概率转移来对具有缩减支撑集的分布进行优化,同时仍确保近乐观性。我们通过在标准环境中的数值实验表明,以这种方式减少探索相比于 UCRL2 及其变体产生了显著的数值改进。在理论方面,这些关键修改使我们能够为 UCRL3 导出优于 UCRL2 的遗憾界,这得益于方差感知集中界,该界首次引入了局部直径和局部有效支撑的概念。
引用
@article{arxiv.2004.09656,
title = {Tightening Exploration in Upper Confidence Reinforcement Learning},
author = {Hippolyte Bourel and Odalric-Ambrym Maillard and Mohammad Sadegh Talebi},
journal= {arXiv preprint arXiv:2004.09656},
year = {2021}
}
备注
Appeared in Proceedings of the 27th International Conference on Machine Learning (ICML 2020). This is an improved post-proceeding version correcting minor errors