冻结解码器-only LLMs的训练持久记忆
机器学习
2026-03-25 v1 人工智能
摘要
解码器-only语言模型是无状态的:隐藏表示在每一次前向传播后都被丢弃,跨会话之间没有任何持久化。Jeong(2026a)展示了通过训练记忆适配器,可为冻结的编码器-解码器主干网络提供持久的潜在空间记忆,这基于Jeong(2026b, 2026c)的侧向记忆框架。本文探讨了相同原理是否也适用于解码器-only设置,即没有跨注意力路径,记忆必须仅通过自注意力机制进入。我们采用六种方法——前缀、平行跨注意力、KV扩展、赫伯茨记忆、上下文门控分支和基于槽位的稀疏写入——针对冻结的GPT-2进行适配,仅训练小型适配器 。写入规则是共享的,只有读取注入方式从解码器的跨注意力更改为自注意力KV前缀或平行分支。在LoCoMo数据集上,我们发现一种惊人的归纳偏置二分法:在1倍容量下,三个具有强烈架构先验的方法——跨注意力(M.2)、赫伯茨记忆(M.4)和槽位写入(M.6)——实现了7%-18%的记忆保持分数和7-10的知识增益 ,而另外三个方法失败(<0.4%)。在10倍容量下,所有六种方法都收敛,表明差距是架构性的,而非根本性的。结合Jeong(2026a)的编码器-解码器结果以及Jeong(2026b, 2026c)的受大脑启发的模块,这些发现确立了持久潜在空间记忆作为涵盖主要Transformer家族的通用范式。
引用
@article{arxiv.2603.22329,
title = {Trained Persistent Memory for Frozen Decoder-Only LLMs},
author = {Hong Jeong},
journal= {arXiv preprint arXiv:2603.22329},
year = {2026}
}