中文

稀疏记忆微调:作为 LoRA 和全参数微调的低遗忘替代方案

计算与语言 2026-05-06 v1 机器学习

摘要

将预训练语言模型适配到新任务时,往往会损害其已有的通用能力,这种问题被称为灾难性遗忘。稀疏记忆微调(Sparse Memory Finetuning,SMF)通过向模型添加关键值记忆层,并在每个训练步骤中仅更新当前 batch 最重读的那少数记忆行来尝试避免这种情况。我们在 Qwen-2.5-0.5B-Instruct 上重新实现 SMF,并在 MedMCQA(4选项医学考试任务)上将其与 LoRA 和全参数微调进行比较,分别使用 WikiText perplexity 和 TriviaQA accuracy 作为遗忘探针。SMF 在 MedMCQA 上提升了 2.5 个百分点,同时将两个遗忘探针保持在基线模型的约 1 个百分点内,而 LoRA 和全参数微调虽取得更大的提升,但在两个指标上都表现出明显的漂移。我们还比较了两种行选择规则(KL 散度和 TF-IDF),这两种规则在两个遗忘指标之间进行不同的权衡。

关键词

引用

@article{arxiv.2605.03229,
  title  = {Sparse Memory Finetuning as a Low-Forgetting Alternative to LoRA and Full Finetuning},
  author = {Prakhar Gupta and Garv Shah and Satyam Goyal and Anirudh Kanchi},
  journal= {arXiv preprint arXiv:2605.03229},
  year   = {2026}
}