中文

Auto-Dreamer:用于语言智能体的离线记忆巩固学习

计算与语言 2026-05-21 v1

摘要

语言智能体越来越多地在相关任务的流中运行,但现有的记忆系统在将积累的经验转化为可重用知识方面存在挑战。检索增强和结构化记忆方法能够有效记录每个会话的观察,但常常将获取和巩固耦合为单一的在线过程,导致智能体在跨会话中缺乏全局视角,无法发现重复模式、抽象共享程序或修剪冗余条目。受补充学习系统理论启发,我们提出Auto-Dreamer,这是一种用于语言智能体记忆的学习型离线巩固器。Auto-Dreamer将快速的每次会话记忆获取与慢速的跨会话巩固解耦。给定选定的类型记忆库的一个工作区域,巩固器将该区域视为只读证据,进行受限工具使用以检查条目和与之关联的源轨迹,并合成一套新的紧凑替换集,以跨会话抽象并取代原有区域。我们通过GRPO训练Auto-Dreamer,以端到端智能体性能作为奖励信号,学习如何巩固通过快速在线经验获取的记忆。在仅使用ScienceWorld轨迹训练后,Auto-Dreamer在ScienceWorld上 outperform固定、RL训练和提示记忆基线7分,同时使用比最强基线12倍小的活跃记忆库,在不重新训练的情况下继续领先于held-out ALFWorld和WebArena——在ALFWorld上使用比最强基线6倍的内存。

关键词

引用

@article{arxiv.2605.20616,
  title  = {Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents},
  author = {Chongrui Ye and Yuxiang Liu and Yu Wang and Haofei Yu and Yining Zhao and Ge Liu and Julian McAuley and Jiaxuan You},
  journal= {arXiv preprint arXiv:2605.20616},
  year   = {2026}
}

备注

Preprint