中文

SEEKR:用于大语言模型持续学习的选择性注意力引导知识保持

计算与语言 2024-11-12 v1 机器学习

摘要

持续学习(CL)对于语言模型动态适应不断演变的现实世界需求至关重要。为了缓解 CL 中的灾难性遗忘问题,数据回放已被证明是一种简单有效的策略,而后续基于数据回放的蒸馏可以进一步提升性能。然而,现有方法未能充分利用来自先前任务的模型中嵌入的知识,导致需要相对大量的回放样本才能取得良好结果。在本文中,我们首先探索并强调了注意力权重在知识保持中的重要性,然后提出了一种选择性注意力引导知识保持方法(SEEKR),用于数据高效的基于回放的持续学习大语言模型(LLM)。具体而言,SEEKR 在选定的注意力头上执行注意力蒸馏,以实现更细粒度的知识保持,其中提出的基于可遗忘性和基于任务敏感性的度量用于识别最有价值的注意力头。在两个 LLM 持续学习基准上的实验结果表明,SEEKR 在性能与效率方面均优于现有方法。具体而言,SEEKR 仅使用其他方法 1/10 的回放数据即可达到可比甚至更好的性能,并将回放数据的比例降低至 1%。

关键词

引用

@article{arxiv.2411.06171,
  title  = {SEEKR: Selective Attention-Guided Knowledge Retention for Continual Learning of Large Language Models},
  author = {Jinghan He and Haiyun Guo and Kuan Zhu and Zihan Zhao and Ming Tang and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2411.06171},
  year   = {2024}
}

备注

EMNLP2024