事后诸葛亮:构建能保留、回忆与反思的智能体记忆
计算与语言
2025-12-16 v1 人工智能
信息检索
机器学习
摘要
智能体记忆被视为基于大语言模型(LLM)应用增长的一个维度,使智能体能够积累经验、跨会话适应并超越单次问答。当前一代智能体记忆系统将记忆视为外部层,从对话中提取显著片段,将其存储在向量或图数据库中,并将top-k项检索到否则无状态模型的提示中。虽然这些系统改善了个性化和上下文延续,但它们仍然模糊了证据与推理之间的界限,难以在长时间尺度上组织信息,且对必须解释其推理的智能体支持有限。我们提出Hindsight,一种将智能体记忆视为结构化的一等推理基质的记忆架构,将其组织为四个逻辑网络以区分世界事实、智能体经验、合成实体摘要和演化信念。该框架支持三个核心操作——保留、回忆与反思——来管理信息的添加、访问与更新。在此抽象下,一个时间感知的、实体意识的记忆层逐步将对话流转化为结构化、可查询的记忆库,而一个反思层对该记忆库进行推理以产生答案并以可追溯的方式更新信息。在LongMemEval和LoCoMo等关键长时序对话记忆基准上,Hindsight配合开源20B模型将整体准确率从全上下文基线的39%提升至83.6%,并超越了全上下文GPT-4o。进一步扩大骨干模型规模将Hindsight在LongMemEval上推至91.4%,在LoCoMo上达到89.61%(vs.此前最强开源系统的75.78%),始终在多会话和开放域问题上优于现有记忆架构。
引用
@article{arxiv.2512.12818,
title = {Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects},
author = {Chris Latimer and Nicoló Boschi and Andrew Neeser and Chris Bartholomew and Gaurav Srivastava and Xuan Wang and Naren Ramakrishnan},
journal= {arXiv preprint arXiv:2512.12818},
year = {2025}
}