“忆”法则:让带状态语言模型掌握自身上下文的力量
人工智能
2026-02-13 v1
摘要
在哈利波特世界中,当杜布拉德的思绪过载时,他会将记忆抽取到“忆”中供以后回顾。在人工智能领域,尽管我们拥有成熟的数据库和检索系统,但我们的模型却莫名其妙地缺少与之互动的“魔杖”。它们仍像没有行动力的杜布拉德一样,被动接受人工设计的上下文作为唯一记忆。本工作终于为模型插上了行动的翅膀。我们引入StateLM,这是一类拥有内部推理循环以管理自身状态的基础模型。我们为模型配备了一套记忆工具,如上下文剪裁、文档索引和笔记记录,并训练其主动管理这些工具。通过学习动态工程自身的上下文,您的模型摆脱了固定窗口的架构牢笼。在各种模型规模上进行的实验表明,StateLM在多种场景中均表现出色:在长文档问答任务中,StateLM在所有模型规模上均显著优于标准LLM;在聊天记忆任务中,实现了标准LLM的10%至20%的准确率提升。在深层研究任务BrowseComp-Plus上,性能差距更为显著:StateLM达到了最高52%的准确率,而标准LLM则僵硬地维持在约5%左右。最终,我们的方法将LLM从被动的预测器转变为具备状态感知能力的智能体,其中推理过程变得具有可管理性和可追踪性。
引用
@article{arxiv.2602.12108,
title = {The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context},
author = {Xiaoyuan Liu and Tian Liang and Dongyang Ma and Deyu Zhou and Haitao Mi and Pinjia He and Yan Wang},
journal= {arXiv preprint arXiv:2602.12108},
year = {2026}
}