超越百万token:长期记忆在大语言模型中的基准测试与提升
计算与语言
2026-02-24 v2 人工智能
信息检索
摘要
评估大语言模型(Large Language Models, LLMs)在需要长期记忆和因此长上下文推理的任务(例如对话情境)方面的能力,受限于现有基准测试——这些基准测试往往缺乏叙事连贯性、覆盖狭窄领域,且仅测试简单的记忆驱动任务。本文提出了综合性解决方案以应对这些挑战。首先,我们提出一种新框架,用于自动生成长(最高达1000万token)、连贯且主题多样化的对话,配以探针问题,针对广泛的记忆能力进行测试。基于此,我们构建了BEAM基准测试,包含100段对话和2000个验证后的问题。其次,为提升模型性能,我们提出LIGHT框架,灵感来自人类认知,为LLMs配备三个互补记忆系统:长期情景记忆、短期工作记忆以及用于积累关键事实的草稿缓存。我们的实验表明,即便是上下文窗口为100万token的LLMs(无论是否包含检索增强)在对话长度增加时表现困难。相比之下,LIGHT在various模型上 consistently 提升了性能,在最强基线之上实现了3.5%至12.69%的平均提升,具体取决于所选底层LLMs。消融研究进一步确认了每个记忆组件的贡献。
引用
@article{arxiv.2510.27246,
title = {Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs},
author = {Mohammad Tavakoli and Alireza Salemi and Carrie Ye and Mohamed Abdalla and Hamed Zamani and J Ross Mitchell},
journal= {arXiv preprint arXiv:2510.27246},
year = {2026}
}