学习记忆:长上下文推理中记忆代理的端到端训练
机器学习
2026-02-24 v1 人工智能
摘要
长上下文LLM和检索增强生成(RAG)系统被动地处理信息,将状态跟踪、矛盾解决和证据聚合推迟到查询时,这在面对频繁更新的超长数据流时变得脆弱。我们提出统一记忆代理(UMA),一个将记忆操作和问答统一于单个策略中的强化学习框架。UMA维护双重记忆表征:一个紧凑的核心摘要用于全局上下文,一个结构化记忆库支持对关键值条目进行显式的创建、更新、删除和重新组织,以实现流式处理期间的主动整合。为评估长期记忆行为,我们引入Ledger-QA,这是一个用于连续状态跟踪的诊断基准,答案是来自累积更新派生的隐性值,而非局部范围检索。在13个数据集(包括Ledger-QA、Test-Time Learning和Accurate Retrieval)上,UMA在动态推理和学习任务上显著优于长上下文和RAG基线,在标准检索基准上保持竞争力,凸显了学习的、端到端记忆管理的重要性。
引用
@article{arxiv.2602.18493,
title = {Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning},
author = {Kehao Zhang and Shangtong Gui and Sheng Yang and Wei Chen and Yang Feng},
journal= {arXiv preprint arXiv:2602.18493},
year = {2026}
}