中文

混合强化学习:同时使用离线与在线数据可提升强化学习效率

机器学习 2023-03-14 v3

摘要

我们考虑一种混合强化学习设定(Hybrid RL),其中智能体可访问一个离线数据集,并能够通过真实世界的在线交互收集经验。该框架缓解了纯离线与纯在线 RL 设定中出现的挑战,使得在理论与实践上均可设计简单且高效的算法。我们通过将经典的 Q 学习/迭代算法适配到混合设定来展示这些优势,称之为混合 Q 学习(Hy-Q)。在理论结果中,我们证明只要离线数据集支持高质量策略且环境具有有界双线性秩,该算法在计算与统计上均是高效的。值得注意的是,与策略梯度/迭代方法的保证不同,我们无需对初始分布所提供的覆盖性作任何假设。在实验结果中,我们表明采用神经网络函数逼近的 Hy-Q 在包括 Montezuma's Revenge 在内的具有挑战性的基准上优于最先进的在线、离线与混合 RL 基线。

关键词

引用

@article{arxiv.2210.06718,
  title  = {Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient},
  author = {Yuda Song and Yifei Zhou and Ayush Sekhari and J. Andrew Bagnell and Akshay Krishnamurthy and Wen Sun},
  journal= {arXiv preprint arXiv:2210.06718},
  year   = {2023}
}

备注

42 pages, 6 figures. Published at ICLR 2023. Code available at https://github.com/yudasong/HyQ