中文

面向长程大语言模型对话的带关键词书签的协作内存分页

计算与语言 2026-05-26 v2 人工智能

摘要

当大语言模型对话超出上下文窗口时,旧内容必须被驱逐——但模型在需要时如何恢复它?我们提出协作分页:被驱逐的片段被替换为最小的关键词书签([pN:关键词],每个约8-24个token),并且模型被赋予一个recall()工具以按需检索完整内容。在LoCoMo基准测试(10个真实的多会话对话,300+轮次)上,协作分页在四种模型(GPT-4o-mini、DeepSeek-v3.2、Claude Haiku、GLM-5)的六种方法中实现了最高的答案质量——优于截断、BM25、词重叠检索、搜索工具基线和完整上下文——经四个独立的LLM评判员确认(p=0.017,配对自助法)。然后,我们通过一个5x4的消融实验(边界策略和驱逐策略)研究了分页设计空间(3176个合成探针,1600个LoCoMo探针)。主要发现:(1)粗粒度的固定大小页面(fixed_20)达到96.7%,而内容感知的topic_shift降至56.7%;(2)驱逐策略的选择依赖于数据(FIFO在合成数据上最佳,LFU在LoCoMo上最佳);(3)两种书签生成策略相比启发式基线有所改进(E2E分数分别提高+4.4和+8.7);(4)剩余的瓶颈是书签区分——模型在96%的情况下触发recall(),但当书签区分度不足时,仅57%的情况下选择了正确的页面。关键词特异性单独就造成了25个百分点的准确率差异。

关键词

引用

@article{arxiv.2604.12376,
  title  = {Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations},
  author = {Ziyang Liu},
  journal= {arXiv preprint arXiv:2604.12376},
  year   = {2026}
}

备注

The authors have decided to withdraw this version following internal review regarding authorship and contribution agreements