从Dirichlet到Rubin:无需奖励项的强化学习乐观探索
机器学习
2022-06-23 v2 机器学习
摘要
我们提出Bayes-UCBVI算法,用于表格化、阶段依赖、情节式马尔可夫决策过程中的强化学习:它是Kaufmann等人(2012)针对多臂老虎机的Bayes-UCB算法的自然扩展。我们的方法使用Q值函数后验的分位数作为最优Q值函数的上置信界。对于Bayes-UCBVI,我们证明了量级的后悔界,其中为一个情节的长度,为状态数,为动作数,为情节数,对于足够大的,该界在的poly-项范围内与下界相匹配。据我们所知,这是首个无需复杂的类Bernstein奖励项或噪声即可获得对时域(及)最优依赖的算法。我们分析的关键在于一个新的加权Dirichlet和的细粒度反集中界,其本身可能具有独立意义。随后我们解释了Bayes-UCBVI如何轻松扩展到表格设定之外,展示了我们的算法与贝叶斯自助法(Rubin, 1981)之间的强联系。
引用
@article{arxiv.2205.07704,
title = {From Dirichlet to Rubin: Optimistic Exploration in RL without Bonuses},
author = {Daniil Tiapkin and Denis Belomestny and Eric Moulines and Alexey Naumov and Sergey Samsonov and Yunhao Tang and Michal Valko and Pierre Menard},
journal= {arXiv preprint arXiv:2205.07704},
year = {2022}
}