中文

持续由LLM更新的有用记忆会变得有故障

人工智能 2026-05-14 v1

摘要

从过去经验中学习需要两种互补的记忆形式:episodic traces——记录实际发生情况的原始轨迹,以及被压缩的抽象概念,这些概念在多个情节中提炼成可重用的、类似模式的教训。近期的智能体记忆系统追求后者:LLM将过去的轨迹改写为文本记忆库,并不断与新交互更新,承诺实现无需参数更新的自我改进智能体。然而我们发现,今天的LLM所产生的集中记忆常常存在故障,即使来自有用经验。随着集中过程的进行,记忆效用首先上升,然后下降,甚至可能低于无记忆基准。更令人惊讶的是,即便在从ground-truth解答出发进行集中,GPT-5.4在54%的ARC-AGI问题上失败,这些问题它之前已在无记忆情况下解决。我们将回归归因于集中步骤而非底层经验:相同的轨迹在不同的更新方案下会产生质态不同的记忆,而episodic-only控制仅保留这些轨迹仍与集中者竞争。我们在受控ARC-AGI Stream环境中暴露保留、删除和集中动作,智能体默认保留原始情节,使其在强制集中情景下的准确率提升了两倍;完全禁用集中(仅使用episodic管理)可与自动方案匹配。实际中,稳健的智能体记忆应将原始情节视为第一等证据,并显式地对集中进行门控,而非在每次交互后自动触发。展望未来,可靠的智能体记忆需要能够在不覆盖其依赖证据的情况下进行集中化的LLM。

关键词

引用

@article{arxiv.2605.12978,
  title  = {Useful Memories Become Faulty When Continuously Updated by LLMs},
  author = {Dylan Zhang and Yanshan Lin and Zhengkun Wu and Yihang Sun and Bingxuan Li and Dianqi Li and Hao Peng},
  journal= {arXiv preprint arXiv:2605.12978},
  year   = {2026}
}