中文

利用密度比进行在线强化学习

机器学习 2024-06-06 v2 机器学习

摘要

离线与在线强化学习的理论尽管并行发展,但已开始显现统一的可能,一种场景下的算法和分析技术往往在另一种场景中有自然的对应。然而,密度比建模——离线强化学习中的一个新兴范式——在很大程度上缺席于在线强化学习,这或许有充分的理由:密度比的存在和有界性依赖于对具有良好覆盖的探索性数据集的访问,而在线强化学习的核心挑战正是收集这样一个数据集,但一开始并没有。在这项工作中,我们表明——或许令人惊讶——基于密度比的算法具有在线对应物。仅假设存在一个具有良好覆盖的探索性分布(一种称为可覆盖性的结构条件,Xie等人,2023),我们给出了一种新算法(GLOW),该算法利用密度比可实现性和值函数可实现性进行样本高效的在线探索。GLOW通过谨慎使用截断来处理无界密度比,并将其与乐观主义相结合以引导探索。GLOW计算效率不高;我们为其补充了一个更高效的对应算法HyGLOW,用于混合强化学习设置(Song等人,2022),其中在线强化学习由额外的离线数据增强。HyGLOW作为一个更通用的元算法的特例推导得出,该元算法提供了从混合强化学习到离线强化学习的可证明的黑箱归约,这可能具有独立的意义。

关键词

引用

@article{arxiv.2401.09681,
  title  = {Harnessing Density Ratios for Online Reinforcement Learning},
  author = {Philip Amortila and Dylan J. Foster and Nan Jiang and Ayush Sekhari and Tengyang Xie},
  journal= {arXiv preprint arXiv:2401.09681},
  year   = {2024}
}

备注

ICLR 2024