利用世界模型掌握记忆任务
机器学习
2024-03-08 v1
摘要
当前基于模型的强化学习 (MBRL) 智能体难以处理长期依赖问题。这限制了它们有效解决动作与结果之间存在较长时间间隔的任务,或利用遥远观测信息来指导当前动作的任务的能力。为提高时间连贯性,我们在 MBRL 智能体的世界模型中集成了一类新的状态空间模型 (SSMs),提出了一种名为 Recall to Imagine (R2I) 的新方法。这种集成旨在增强长期记忆和长时域信用分配。通过一系列多样化的示例任务,我们系统地证明了 R2I 不仅在 BSuite 和 POPGym 等具有挑战性的记忆和信用分配强化学习任务中建立了新的 state-of-the-art,而且在 Memory Maze 这一复杂记忆领域展示了超越人类的表现。同时,它在 Atari 和 DMC 等经典强化学习任务中保持了相当的性能,表明了我们方法的通用性。我们还表明,R2I 比 state-of-the-art 的 MBRL 方法 DreamerV3 更快,从而实现了更快的墙钟时间收敛。
引用
@article{arxiv.2403.04253,
title = {Mastering Memory Tasks with World Models},
author = {Mohammad Reza Samsami and Artem Zholus and Janarthanan Rajendran and Sarath Chandar},
journal= {arXiv preprint arXiv:2403.04253},
year = {2024}
}
备注
Published as a conference paper at The International Conference on Learning Representations 2024