通过增强世界模型中的回放实现持续强化学习
机器学习
2024-07-17 v3 人工智能
摘要
持续强化学习要求智能体在不忘记先前任务的同时,提升在过去和未来任务上的性能。常见方法采用无模型算法,回放缓冲区可帮助缓解灾难性遗忘,但常因大规模内存需求而面临可扩展性挑战。受生物学启发的回放建议将回放至世界模型中,这与基于模型的强化学习相吻合,区别于无模型算法中的回放。基于模型的强化学习通过利用环境知识(独立于策略)为持续强化学习提供优势。我们引入WMAR(World Models with Augmented Replay),一种具有内存高效分布匹配回放缓冲区的基于模型的强化学习算法。WMAR扩展了著名的DreamerV3算法,该算法采用简单的FIFO缓冲区且尚未在持续强化学习中进行测试。我们对比评估了WMAR和DreamerV3,两者使用的回放缓冲区规模相同。它们分别在使用OpenAI Procgen的共享结构任务和使用Atari基准的非共享结构任务中进行测试。WMAR在考虑遗忘以及技能转移等指标时展现出有利特性。相较于DreamerV3,WMAR在共享结构任务中表现出轻微优势,而在非共享结构任务中遗忘特性显著更好。我们的结果表明,基于模型的强化学习配合内存高效回放缓冲区可是持续强化学习的有效方法,值得进一步研究。
引用
@article{arxiv.2401.16650,
title = {Augmenting Replay in World Models for Continual Reinforcement Learning},
author = {Luke Yang and Levin Kuhlmann and Gideon Kowadlo},
journal= {arXiv preprint arXiv:2401.16650},
year = {2024}
}