中文

在在线强化学习中利用离线数据

机器学习 2023-07-21 v2 人工智能 机器学习

摘要

强化学习(RL)领域出现了两个核心范式:在线 RL 和离线 RL。在在线 RL 设定中,智能体对环境没有先验知识,必须与之交互以找到 ϵ\epsilon-最优策略。在离线 RL 设定中,学习器可访问固定数据集进行学习,但无法以其他方式与环境交互,必须从该离线数据中获得其能达到的最佳策略。实际场景常常促使一种中间设定:如果我们拥有一些离线数据,并且此外还可以与环境交互,我们如何最好地利用离线数据来最小化学习 ϵ\epsilon-最优策略所需的在线交互次数?在这项工作中,我们考虑这一设定,我们称之为 \textsf{FineTuneRL} 设定,针对具有线性结构的 MDP。我们刻画了在可访问某些离线数据集的情况下该设定所需的在线样本数量,并开发了一种算法 \textsc{FTPedel},该算法在 HH 因子范围内是可证明最优的。我们通过一个显式示例表明,将离线数据与在线交互结合可带来相对于纯离线或纯在线 RL 的可证明改进。最后,我们的结果阐明了\emph{可验证}学习(在线 RL 中通常考虑的设定)与\emph{不可验证}学习(离线 RL 中常考虑的设定)之间的区别,并表明这些机制之间存在形式上的分离。

关键词

引用

@article{arxiv.2211.04974,
  title  = {Leveraging Offline Data in Online Reinforcement Learning},
  author = {Andrew Wagenmaker and Aldo Pacchiano},
  journal= {arXiv preprint arXiv:2211.04974},
  year   = {2023}
}