中文

大型语言模型的塞姆斯双语记忆相互编织

计算与语言 2024-12-24 v1

摘要

参数高效微调(PEFT)方法通过修改或引入少量参数来优化大型语言模型(LLM),以增强其与下游任务的对齐。然而,这些方法可能导致灾难性遗忘,即 LLM 在处理新知识时优先于牺牲全面世界知识。一个缓解此问题的可行方法是根据原始知识召回先前的记忆。为此,我们提出了一个模型无关的 PEFT 框架 IMSM,即 Interweave Memories of a Siamese Large Language Model。具体而言,我们的塞姆斯 LLM 配备了现有的 PEFT 方法。给定输入查询后,IMSMA 会基于预训练参数和微调参数生成两个不同的记忆。IMSMA 然后采用一种 interweaving 机制来调节原始记忆和增强记忆在生成下一个 token 时的贡献。该框架理论上适用于所有开源 LLM 和现有的 PEFT 方法。我们在 various benchmark 数据集上进行了大量实验,评估了使用 IMSMA 的流行开源 LLM 的性能,并将其与经典和领先的 PEFT 方法进行了比较。我们的发现表明,IMSMA 在保持与主干 PEFT 方法相当的时间和空间效率的同时,显著提高了性能,并有效地缓解了灾难性遗忘。

关键词

引用

@article{arxiv.2412.17383,
  title  = {Interweaving Memories of a Siamese Large Language Model},
  author = {Xin Song and Zhikai Xue and Guoxiu He and Jiawei Liu and Wei Lu},
  journal= {arXiv preprint arXiv:2412.17383},
  year   = {2024}
}

备注

Accepted by AAAI 2025 Main Conference