持续基于模型的强化学习中的知识保持
机器学习
2025-06-09 v4 人工智能
摘要
我们提出 DRAGO,一种用于持续基于模型的强化学习的新方法,旨在改善在一系列任务上的世界模型的增量开发,这些任务在奖励函数上有所不同,但在状态空间或动力学上相同。DRAGO 包含两个关键组件:合成经验重放,利用生成模型从过去任务中创建合成经验,使智能体无需存储数据即可强化先前学到的动力学;以及通过探索重获记忆,引入内在奖励机制引导智能体重访先前任务中的相关状态。这些组件共同使智能体能够保持一个全面且持续发展的世界模型,促进在多样化环境中的更有效学习和适应。实证评估表明 DRAGO 能够在任务之间保持知识,在各种持续学习场景中取得优越性能。
引用
@article{arxiv.2503.04256,
title = {Knowledge Retention for Continual Model-Based Reinforcement Learning},
author = {Yixiang Sun and Haotian Fu and Michael Littman and George Konidaris},
journal= {arXiv preprint arXiv:2503.04256},
year = {2025}
}