中文

SAPT:一种面向大语言模型参数高效持续学习的共享注意力框架

计算与语言 2024-06-07 v3

摘要

持续学习(CL)能力对于在动态世界中部署大语言模型(LLMs)至关重要。现有方法设计学习模块以通过参数高效微调(PET)块获取任务特定知识,并设计选择模块为测试输入挑选相应模块,旨在应对CL中的灾难性遗忘和知识迁移挑战。然而,这些方法往往只解决其中一个挑战,忽略了协调这两个模块以同时有效应对灾难性遗忘和知识迁移的潜力。为此,我们提出一种新颖的共享注意力框架(SAPT),通过共享注意力学习与选择模块来协调PET学习和选择。在两个CL基准上的大量实验证明了SAPT的优越性。此外,当我们将SAPT扩展到不同模型规模(从770M到13B)、不同模型架构(T5和LLaMA-2)以及未见过的任务时,它始终展现出优越性。

关键词

引用

@article{arxiv.2401.08295,
  title  = {SAPT: A Shared Attention Framework for Parameter-Efficient Continual Learning of Large Language Models},
  author = {Weixiang Zhao and Shilong Wang and Yulin Hu and Yanyan Zhao and Bing Qin and Xuanyu Zhang and Qing Yang and Dongliang Xu and Wanxiang Che},
  journal= {arXiv preprint arXiv:2401.08295},
  year   = {2024}
}

备注

To appear at ACL 2024