中文

从Dirichlet到Rubin:无需奖励项的强化学习乐观探索

机器学习 2022-06-23 v2 机器学习

摘要

我们提出Bayes-UCBVI算法,用于表格化、阶段依赖、情节式马尔可夫决策过程中的强化学习:它是Kaufmann等人(2012)针对多臂老虎机的Bayes-UCB算法的自然扩展。我们的方法使用Q值函数后验的分位数作为最优Q值函数的上置信界。对于Bayes-UCBVI,我们证明了O~(H3SAT)\widetilde{O}(\sqrt{H^3SAT})量级的后悔界,其中HH为一个情节的长度,SS为状态数,AA为动作数,TT为情节数,对于足够大的TT,该界在H,S,A,TH,S,A,T的poly-log\log项范围内与下界Ω(H3SAT)\Omega(\sqrt{H^3SAT})相匹配。据我们所知,这是首个无需复杂的类Bernstein奖励项或噪声即可获得对时域HH(及SS)最优依赖的算法。我们分析的关键在于一个新的加权Dirichlet和的细粒度反集中界,其本身可能具有独立意义。随后我们解释了Bayes-UCBVI如何轻松扩展到表格设定之外,展示了我们的算法与贝叶斯自助法(Rubin, 1981)之间的强联系。

关键词

引用

@article{arxiv.2205.07704,
  title  = {From Dirichlet to Rubin: Optimistic Exploration in RL without Bonuses},
  author = {Daniil Tiapkin and Denis Belomestny and Eric Moulines and Alexey Naumov and Sergey Samsonov and Yunhao Tang and Michal Valko and Pierre Menard},
  journal= {arXiv preprint arXiv:2205.07704},
  year   = {2022}
}