覆盖性在在线强化学习中的作用
机器学习
2022-10-11 v1 人工智能
最优化与控制
机器学习
摘要
覆盖条件——断言数据记录分布充分覆盖状态空间——在决定离线强化学习的样本复杂度方面起着基础性作用。尽管此类条件乍看与在线强化学习无关,我们建立了一种新的联系,并有些出人意料地表明:仅存在一个具有良好覆盖性的数据分布,就能实现样本高效的在线 RL。具体而言,我们表明覆盖性(coverability)——即存在一个满足称为可集中性(concentrability)的普遍覆盖条件的数据分布——可视为底层 MDP 的结构性质,并且即使智能体不知晓该分布,也可被标准算法用于样本高效探索。我们补充证明,若干较弱的覆盖概念虽足以支撑离线 RL,却不足以支撑在线 RL。我们还表明,现有在线 RL 的复杂度度量(包括 Bellman 秩与 Bellman-Eluder 维)未能最优地刻画覆盖性,并提出了一种新的复杂度度量——序列外推系数(sequential extrapolation coefficient)——以提供统一刻画。
引用
@article{arxiv.2210.04157,
title = {The Role of Coverage in Online Reinforcement Learning},
author = {Tengyang Xie and Dylan J. Foster and Yu Bai and Nan Jiang and Sham M. Kakade},
journal= {arXiv preprint arXiv:2210.04157},
year = {2022}
}