中文

一种可证明高效的免模型后验采样方法用于情节式强化学习

机器学习 2022-08-24 v1

摘要

Thompson Sampling 是情境多臂老虎机最有效的方法之一,并已推广到某些 MDP 设置下的后验采样。然而,现有的强化学习后验采样方法局限于基于模型,或缺乏超越线性 MDP 的最坏情况理论保证。本文提出了一种新的免模型后验采样公式,可应用于更一般的情节式强化学习问题并带有理论保证。我们引入新的证明技术以表明,在适当条件下,我们后验采样方法的最坏情况后悔界与基于优化的已知最佳结果相匹配。在维度为 dd 的线性 MDP 设置中,我们算法的后悔随维度线性缩放,而现有的基于后验采样的探索算法呈二次依赖。

关键词

引用

@article{arxiv.2208.10904,
  title  = {A Provably Efficient Model-Free Posterior Sampling Method for Episodic Reinforcement Learning},
  author = {Christoph Dann and Mehryar Mohri and Tong Zhang and Julian Zimmert},
  journal= {arXiv preprint arXiv:2208.10904},
  year   = {2022}
}