Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
计算与语言
2026-01-15 v5 多智能体系统
摘要
大型语言模型(LLMs)在广泛的 NLP 任务中展现出惊人的能力,但其本质上是无状态的,受限于有限的上下文窗口,阻碍了长期推理。近期努力常通过外部记忆库来增强 LLMs,但大多数现有管道是静态且基于经验的,缺乏关于存储、更新或检索的学习机制。我们提出 Memory-R1,一种强化学习(RL)框架,使 LLMs 能够通过两个专门的智能体主动管理和利用外部记忆:Memory Manager 学习结构化操作,包括 ADD、UPDATE、DELETE 和 NOOP;Answer Agent 预先选择并对相关条目进行推理。两个智能体均使用以结果为导向的 RL(PPO 和 GRPO)进行微调,实现最小监督下的自适应记忆管理。仅需 152 个训练 QA 对,Memory-R1 在 diverse question types、三个基准(LoCoMo、MSC、LongMemEval)以及多个模型规模(3B-14B)上均优于强大基线。
引用
@article{arxiv.2508.19828,
title = {Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning},
author = {Sikuan Yan and Xiufeng Yang and Zuchao Huang and Ercong Nie and Zifeng Ding and Zonggen Li and Xiaowen Ma and Jinhe Bi and Kristian Kersting and Jeff Z. Pan and Hinrich Schütze and Volker Tresp and Yunpu Ma},
journal= {arXiv preprint arXiv:2508.19828},
year = {2026}
}