中文

TokMem:大语言模型的单 token 程序记忆

计算与语言 2026-03-10 v2

摘要

大语言模型通常通过提示词进行控制,这些提示词必须为每个新查询重复处理,且难以以模块化方式重用。我们引入 TokMem,一种程序记忆框架,将每个可重用任务程序编译为单个可训练记忆 token。每个 token 既作为程序索引,又作为生成控制信号,引导生成,从而实现目标化行为且开销恒定。TokMem 保持主干 LLM 冻结,将程序知识完全存储在这些专用单元中,因此可以在不干扰现有程序的情况下持续添加新程序。我们在两个设置上评估 TokMem:对 1,000 个 Super-Natural Instructions 任务的原子记忆以及多步骤函数调用的组合记忆。我们的结果表明,TokMem 在避免重复上下文开销的同时,持续优于检索增强式提示方法。此外,它匹配或超过参数高效微调,所需可训练参数大幅减少。

关键词

引用

@article{arxiv.2510.00444,
  title  = {TokMem: One-Token Procedural Memory for Large Language Models},
  author = {Zijun Wu and Yongchang Hao and Lili Mou},
  journal= {arXiv preprint arXiv:2510.00444},
  year   = {2026}
}

备注

Accepted by ICLR 2026