中文

基于扩散模型的持续离线强化学习:双生成式回放

机器学习 2024-04-19 v2 人工智能

摘要

我们研究了持续离线强化学习,这是一种实用范式,可实现前向迁移并缓解灾难性遗忘,以应对顺序离线任务。我们提出了一种双生成式回放框架,通过并发回放生成的伪数据来保留先前知识。首先,我们将持续学习策略分解为基于扩散的生成行为模型和多头动作评估模型,使策略能够继承分布表达性,以涵盖逐渐多样化的行为范围。其次,我们训练一个任务条件扩散模型来模拟过去任务的状态分布。生成的状态与行为生成器的相应响应配对,以高保真度回放样本表示旧任务。最后,通过交错伪样本与新任务的真实样本,我们持续更新状态和行为生成器以建模逐渐多样化的行为,并通过行为克隆来正则化多头批评家以减缓遗忘。实验表明,我们的方法在实现更好的前向迁移方面效果更好,遗忘更少,并且由于高保真度的样本空间回放,接近使用先前真实数据的效果。我们的代码可在\href{https://github.com/NJU-RL/CuGRO}{https://github.com/NJU-RL/CuGRO}获取。

关键词

引用

@article{arxiv.2404.10662,
  title  = {Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay},
  author = {Jinmei Liu and Wenbin Li and Xiangyu Yue and Shilin Zhang and Chunlin Chen and Zhi Wang},
  journal= {arXiv preprint arXiv:2404.10662},
  year   = {2024}
}