世界模型在持续强化学习中的有效性
机器学习
2023-07-14 v2 人工智能
摘要
世界模型驱动了一些最高效的强化学习算法。在本文中,我们展示了它们可被用于持续学习——即智能体面临不断变化环境的情况。世界模型通常采用回放缓冲进行训练,这可自然扩展到持续学习。我们系统研究了不同的选择性经验回放方法如何影响性能、遗忘与迁移。我们还就使用世界模型的多种建模选择给出了建议。这组最佳选择称为 Continual-Dreamer,它是任务无关的,并利用世界模型进行持续探索。Continual-Dreamer 样本高效,并在 Minigrid 与 Minihack 基准上优于最先进的任务无关持续强化学习方法。
引用
@article{arxiv.2211.15944,
title = {The Effectiveness of World Models for Continual Reinforcement Learning},
author = {Samuel Kessler and Mateusz Ostaszewski and Michał Bortkiewicz and Mateusz Żarski and Maciej Wołczyk and Jack Parker-Holder and Stephen J. Roberts and Piotr Miłoś},
journal= {arXiv preprint arXiv:2211.15944},
year = {2023}
}
备注
Accepted at CoLLAs 2023, 21 pages, 15 figures