中文

覆盖性在在线强化学习中的作用

机器学习 2022-10-11 v1 人工智能 最优化与控制 机器学习

摘要

覆盖条件——断言数据记录分布充分覆盖状态空间——在决定离线强化学习的样本复杂度方面起着基础性作用。尽管此类条件乍看与在线强化学习无关,我们建立了一种新的联系,并有些出人意料地表明:仅存在一个具有良好覆盖性的数据分布,就能实现样本高效的在线 RL。具体而言,我们表明覆盖性(coverability)——即存在一个满足称为可集中性(concentrability)的普遍覆盖条件的数据分布——可视为底层 MDP 的结构性质,并且即使智能体不知晓该分布,也可被标准算法用于样本高效探索。我们补充证明,若干较弱的覆盖概念虽足以支撑离线 RL,却不足以支撑在线 RL。我们还表明,现有在线 RL 的复杂度度量(包括 Bellman 秩与 Bellman-Eluder 维)未能最优地刻画覆盖性,并提出了一种新的复杂度度量——序列外推系数(sequential extrapolation coefficient)——以提供统一刻画。

关键词

引用

@article{arxiv.2210.04157,
  title  = {The Role of Coverage in Online Reinforcement Learning},
  author = {Tengyang Xie and Dylan J. Foster and Yu Bai and Nan Jiang and Sham M. Kakade},
  journal= {arXiv preprint arXiv:2210.04157},
  year   = {2022}
}