通过函数标记在大语言模型中实现记忆检索与巩固
计算与语言
2025-10-10 v1 人工智能
摘要
大语言模型 (LLM) 的卓越成功源于其在预训练期间将海量知识整合到记忆中,并在推理期间检索这些知识,实现知识记忆、指令跟随及推理等高级能力。然而,LLM 中记忆检索与巩固的机制仍鲜有了解。本文提出函数标记假说以解释 LLM 的工作原理:在推理期间,函数标记激活上下文中最具预测性的特征,主导下一个标记的预测(记忆检索);在预训练期间,预测跟随函数标记的下一个标记(通常为内容标记)增加 LLM 所学特征的数量并更新模型参数(记忆巩固)。此处的函数标记大致对应语言学中的功能词,包括标点符号、冠词、介词和连词,区别于内容标记。我们提供大量实证支持该假说的证据。通过二分图分析表明,少数函数标记激活绝大多数特征。案例研究进一步揭示函数标记如何激活上下文中最具预测性的特征以指导下一个标记的预测。我们还发现,预训练期间,训练损失主要来自预测函数标记后续的内容标记,这迫使函数标记从上下文中选择最具预测性的特征。
引用
@article{arxiv.2510.08203,
title = {Memory Retrieval and Consolidation in Large Language Models through Function Tokens},
author = {Shaohua Zhang and Yuan Lin and Hang Li},
journal= {arXiv preprint arXiv:2510.08203},
year = {2025}
}