中文

数据增量的持续离线强化学习

机器学习 2024-12-17 v3

摘要

在这项工作中,我们提出了一种新的持续学习设定:数据增量持续离线强化学习(DICORL),在该设定中,智能体被要求持续学习单个离线强化学习(RL)任务的一系列数据集,而不是学习一系列带有各自数据集的离线 RL 任务。然后,我们提出这种新设定将给持续学习带来一个独特的挑战:主动遗忘,这意味着智能体会主动遗忘已学到的技能。主动遗忘的主要原因是离线 RL 所使用的保守学习,该方法用于解决过估计问题。通过保守学习,离线 RL 方法会不加选择地抑制所有已学或未学动作的值,除非它处于正在学习的数据集中。因此,由于学习顺序的原因,劣质数据可能会覆盖优质数据。为了解决这个问题,我们提出了一种名为基于经验回放的集成隐式 Q 学习(EREIQL)的新算法,该算法引入多个价值网络以降低初始值并避免使用保守学习,同时利用经验回放来缓解灾难性遗忘。我们的实验表明,EREIQL 缓解了 DICORL 中的主动遗忘并表现良好。

关键词

引用

@article{arxiv.2404.12639,
  title  = {Data-Incremental Continual Offline Reinforcement Learning},
  author = {Sibo Gai and Donglin Wang},
  journal= {arXiv preprint arXiv:2404.12639},
  year   = {2024}
}

备注

10 pages, 9 figures