中文

MEMENTO:教会 LLM 管理自身上下文

人工智能 2026-04-14 v1 机器学习

摘要

推理模型在长而无结构的流中思考,缺乏压缩或组织自身中间状态的机制。我们引入MEMENTO:一种教会模型将推理分解为多个块、压缩每个块生成密集状态摘要(memento),并仅依据memento注意力前进,从而降低上下文、KV缓存和计算开销。为训练MEMENTO模型,我们发布OpenMementos,即来自OpenThoughts-v3派生的22.8万条推理轨迹数据集,包含分段和中间摘要标注。我们表明,针对OpenMementos进行的两阶段SFT训练对不同模型家族(Qwen3、Phi-4、Olmo3)及规模(8B至32B参数)均有效。训练后的模型在数学、科学和编码基准测试中保持强大的准确性,同时实现约2.5倍的峰值KV缓存降低。我们扩展vLLM以支持推理方法,实现约1.75倍的吞吐量提升,同时使我们能够进行RL训练并进一步提升准确性。最后,我们识别出双重信息流:来自每个推理块的信息既通过memento文本传递,也通过相应的KV状态传递,后者保留了原始块中隐式的信息。移除此通道后,在AIME24上准确率下降15个百分点。

关键词

引用

@article{arxiv.2604.09852,
  title  = {MEMENTO: Teaching LLMs to Manage Their Own Context},
  author = {Vasilis Kontonis and Yuchen Zeng and Shivam Garg and Lingjiao Chen and Hao Tang and Ziyan Wang and Ahmed Awadallah and Eric Horvitz and John Langford and Dimitris Papailiopoulos},
  journal= {arXiv preprint arXiv:2604.09852},
  year   = {2026}
}