Memory Gym:面向无尽任务以基准测试智能体的记忆能力
机器学习
2025-01-22 v6
摘要
Memory Gym提供了一套2D部分可观测环境,即Mortar Mayhem、Mystery Path与Searing Spotlights,旨在基准测试决策智能体的记忆能力。这些环境原具有限任务,现被扩展为创新的无尽格式,映射了累积记忆游戏(如“我装了我的包”)逐步升级的挑战。任务设计的这一演进将关注点从仅评估样本效率,转向同时探究动态、长时场景中的记忆有效程度。为弥补基于记忆的深度强化学习基线可用性的缺口,我们在开源CleanRL库中引入一种实现,将Transformer-XL (TrXL)与近端策略优化相集成。该方法将TrXL用作一种情景记忆,采用滑动窗口技术。我们对门控循环单元(GRU)与TrXL的比较研究揭示了在有限与无尽任务上的不同表现。TrXL在有限环境中展现出优于GRU的有效性,但仅当使用辅助损失重建观测时方可。值得注意的是,GRU在所有无尽任务中显著回归,持续以显著幅度优于TrXL。网站与源代码:https://marcometer.github.io/jmlr_2024.github.io/
引用
@article{arxiv.2309.17207,
title = {Memory Gym: Towards Endless Tasks to Benchmark Memory Capabilities of Agents},
author = {Marco Pleines and Matthias Pallasch and Frank Zimmer and Mike Preuss},
journal= {arXiv preprint arXiv:2309.17207},
year = {2025}
}
备注
40 pages, 12 figures, 7 tables, accepted at JMLR