TokMem:大语言模型的单 token 程序记忆
计算与语言
2026-03-10 v2
摘要
大语言模型通常通过提示词进行控制,这些提示词必须为每个新查询重复处理,且难以以模块化方式重用。我们引入 TokMem,一种程序记忆框架,将每个可重用任务程序编译为单个可训练记忆 token。每个 token 既作为程序索引,又作为生成控制信号,引导生成,从而实现目标化行为且开销恒定。TokMem 保持主干 LLM 冻结,将程序知识完全存储在这些专用单元中,因此可以在不干扰现有程序的情况下持续添加新程序。我们在两个设置上评估 TokMem:对 1,000 个 Super-Natural Instructions 任务的原子记忆以及多步骤函数调用的组合记忆。我们的结果表明,TokMem 在避免重复上下文开销的同时,持续优于检索增强式提示方法。此外,它匹配或超过参数高效微调,所需可训练参数大幅减少。
引用
@article{arxiv.2510.00444,
title = {TokMem: One-Token Procedural Memory for Large Language Models},
author = {Zijun Wu and Yongchang Hao and Lili Mou},
journal= {arXiv preprint arXiv:2510.00444},
year = {2026}
}
备注
Accepted by ICLR 2026