中文

贝尔曼 Eluder 维数:新的丰富强化学习问题类与样本高效算法

机器学习 2021-07-19 v4 人工智能 机器学习

摘要

寻找能使样本高效学习成为可能的最小结构假设是强化学习(RL)中最重要的研究方向之一。本文通过引入一种新的复杂度度量——贝尔曼 Eluder(BE)维数,推进了我们对这一基本问题的理解。我们表明,低 BE 维数的 RL 问题族极其丰富,它包含了绝大多数现有可处理的 RL 问题,包括但不限于表格 MDP、线性 MDP、反应式 POMDP、低贝尔曼秩问题以及低 Eluder 维数问题。本文进一步设计了一种新的基于优化的算法——GOLF,并重新分析了基于假设消除的算法——OLIVE(由 Jiang 等人于 2017 年提出)。我们证明,两种算法都能以在所有相关参数上多项式、但与状态-动作空间大小无关的样本数学习低 BE 维数问题的近最优策略。我们的后悔值和样本复杂度结果匹配或改进了若干知名低 BE 维数问题子类的最佳现有结果。

关键词

引用

@article{arxiv.2102.00815,
  title  = {Bellman Eluder Dimension: New Rich Classes of RL Problems, and Sample-Efficient Algorithms},
  author = {Chi Jin and Qinghua Liu and Sobhan Miryoosefi},
  journal= {arXiv preprint arXiv:2102.00815},
  year   = {2021}
}