贝尔曼 Eluder 维数:新的丰富强化学习问题类与样本高效算法
机器学习
2021-07-19 v4 人工智能
机器学习
摘要
寻找能使样本高效学习成为可能的最小结构假设是强化学习(RL)中最重要的研究方向之一。本文通过引入一种新的复杂度度量——贝尔曼 Eluder(BE)维数,推进了我们对这一基本问题的理解。我们表明,低 BE 维数的 RL 问题族极其丰富,它包含了绝大多数现有可处理的 RL 问题,包括但不限于表格 MDP、线性 MDP、反应式 POMDP、低贝尔曼秩问题以及低 Eluder 维数问题。本文进一步设计了一种新的基于优化的算法——GOLF,并重新分析了基于假设消除的算法——OLIVE(由 Jiang 等人于 2017 年提出)。我们证明,两种算法都能以在所有相关参数上多项式、但与状态-动作空间大小无关的样本数学习低 BE 维数问题的近最优策略。我们的后悔值和样本复杂度结果匹配或改进了若干知名低 BE 维数问题子类的最佳现有结果。
引用
@article{arxiv.2102.00815,
title = {Bellman Eluder Dimension: New Rich Classes of RL Problems, and Sample-Efficient Algorithms},
author = {Chi Jin and Qinghua Liu and Sobhan Miryoosefi},
journal= {arXiv preprint arXiv:2102.00815},
year = {2021}
}