中文

基于决策-估计系数的无模型强化学习

机器学习 2023-08-15 v2 最优化与控制 统计理论 机器学习 统计理论

摘要

我们考虑交互式决策问题,涵盖结构化 bandit 和具有通用函数逼近的强化学习。最近,Foster 等人(2021)引入了决策-估计系数,这是一种统计复杂度的度量,给出了交互式决策最优遗憾的下界,以及一种元算法 Estimation-to-Decisions,其在该同一量上实现了上界。Estimation-to-Decisions 是一种归约,将(监督式)在线估计算法提升为决策算法。在本文中,我们展示了通过将 Estimation-to-Decisions 与 Zhang(2022)引入的一种特殊形式的乐观估计相结合,可以获得比 Foster 等人(2021)的保证有所改进的保证,方法是容纳更宽松的估计误差概念。我们使用这种方法推导了具有值函数逼近的无模型强化学习的遗憾界,并给出了结构结果,说明它在一般情况下何时能以及何时不能提供帮助。

关键词

引用

@article{arxiv.2211.14250,
  title  = {Model-Free Reinforcement Learning with the Decision-Estimation Coefficient},
  author = {Dylan J. Foster and Noah Golowich and Jian Qian and Alexander Rakhlin and Ayush Sekhari},
  journal= {arXiv preprint arXiv:2211.14250},
  year   = {2023}
}

备注

V2 changes: Improved writing and added more examples