面向混合RL的在线算法的一个天然扩展
机器学习
2024-03-19 v2 机器学习
摘要
混合强化学习(RL)利用在线和离线数据,近年来受到关注,但关于其可证明优势的研究仍寥寥。此外,许多现有的混合RL算法(Song等人,2023;Nakamoto等人,2023;Amortila等人,2024)都对离线数据集施加覆盖假设,但我们表明这并非必需。一个设计良好的在线算法应该"填补"离线数据集中的空白,探索行为策略未探索的状态和动作。与之前关注通过估计离线数据分布来指导在线探索(Li等人,2023b)的不同的方法,我们表明,一种对标准乐观在线算法的自然扩展——通过将离线数据集包含在经验回放缓冲区中进行热启动——即使离线数据集不具备单策略集中性,也能从混合数据中获得类似的可证明收益。我们通过将状态-动作空间分为两个部分,通过离线复杂度度量和在线复杂度度量分别对每个部分的后悔进行界限,并表明该混合RL算法的后悔可以由最佳分区来刻画——尽管该算法本身并不知道该分区。作为一个例子,我们提出了DISC-GOLF,这是一种对现有乐观在线算法的修改,该算法在Jin等人(2021);Xie等人(2022a)使用的具有通用函数逼近的GOLF算法之上的 modifications,表明它在纯在线和纯离线强化学习之上都具有可证明的收益,在针对表格型、线性和块状MDP情况进行专业化时也具有竞争性的界限。数值仿真进一步验证了我们理论上混合数据促进更高效探索的观点,支持混合RL在各种场景中的潜力。
引用
@article{arxiv.2403.09701,
title = {A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage},
author = {Kevin Tan and Ziping Xu},
journal= {arXiv preprint arXiv:2403.09701},
year = {2024}
}
备注
Submitted to the reinforcement learning conference