EngramaBench:基于结构化图检索评估长期对话记忆
计算与语言
2026-04-24 v1 人工智能
摘要
大型语言模型助手日益期望能够保留和推理跨越多个会话期间积累的信息。我们引入 EngramaBench,一个围绕五个角色、一百个多会话对话和一百五十个查询构建的长期对话记忆基准,涵盖事实性记忆、跨空间整合、时间推理、对抗性退让和新兴综合等方面。我们评估了 Engrama、一个基于图结构记忆系统的系统,与 GPT-4o 全景提示和 Mem0(一个开源向量检索记忆系统)进行比较。所有三个系统都使用相同的回答模型 (GPT-4o),从而隔离了记忆架构的影响。GPT-4o 全景提示获得的最高综合得分(0.6186),而 Engrama 综合得分为 0.5367,但是唯一在跨空间推理方面得分高于全景提示的系统(0.6532 vs. 0.6291,n=30)。Mem0 成本最低但显著较弱(0.4809)。消融实验表明,驱动 Engrama 在跨空间方面优势的组件在综合得分上存在权衡,暴露了结构化记忆专长与整体优化之间的系统层面的张力。
关键词
引用
@article{arxiv.2604.21229,
title = {EngramaBench: Evaluating Long-Term Conversational Memory with Structured Graph Retrieval},
author = {Julian Acuna},
journal= {arXiv preprint arXiv:2604.21229},
year = {2026}
}
备注
9 pages, 2 figures, 3 tables