中文

知识卸载:稀疏主干与记忆模块的 LLM 解构

机器学习 2026-05-29 v1

摘要

LLM 在单个参数集合中编码了通用能力和领域特定知识。我们询问这种容量是否可以重新组织:将广泛有用的计算保留在共享主干中,同时将特定的知识移动到外部记忆模块中。我们提出了知识卸载 (KOFF),一种用于将预训练的 LLM 解构为稀疏共享主干和领域特定记忆的框架。从冻结的基础模型开始,我们联合学习一个结构化稀疏掩码和轻量级恢复模块,后者实现为 LoRA 适配器和已学习的键值缓存。对于来自 Llama 和 Qwen 的 3B 到 8B 的模型,我们发现可以在不显著损失模型能力的前提下,将非平凡的容量从共享主干中移出。在约 12% 的全局稀疏度下,KOFF 保留了大部分未被稀疏化模型的性能,而不带记忆模块的相同冻结模型修剪则显著下降。消融实验表明,LoRA 和已学习的 KV 记忆是互补的,特别化分析表明所学的解构是有意义的:语言特定的神经元优先被移除,而语言通用的神经元大部分保留在主干中。这些结果表明,知识可以在共享核心和可交换外部记忆之间重新分配。

关键词

引用

@article{arxiv.2605.29075,
  title  = {Knowledge Offloading: Decomposing LLMs into Sparse Backbones and Memory Modules},
  author = {Karim Galliamov and Rochelle Choenni and Ivan Titov},
  journal= {arXiv preprint arXiv:2605.29075},
  year   = {2026}
}