中文

度量空间中可证明自适应的强化学习

机器学习 2021-10-22 v2 机器学习

摘要

我们研究赋予度量的连续状态与动作空间中的强化学习。我们提供了对 Sinclair、Banerjee 和 Yu(2019)算法变体的精细化分析,并证明其遗憾值随实例的\emph{缩放维数}而缩放。该参数源于赌博机文献,刻画了近最优动作子集的大小,且总是小于先前分析中使用的覆盖维数。因此,我们的结果是度量空间中强化学习的首个可证明自适应性保证。

关键词

引用

@article{arxiv.2006.10875,
  title  = {Provably adaptive reinforcement learning in metric spaces},
  author = {Tongyi Cao and Akshay Krishnamurthy},
  journal= {arXiv preprint arXiv:2006.10875},
  year   = {2021}
}

备注

Published in NeurIPS 2020. This version fixes a bug in the published version