中文

面向大语言模型的逐头可共享注意力

计算与语言 2024-10-25 v3

摘要

大语言模型(LLM)参数数量庞大,限制了其在边缘设备上的部署。权重共享是一种有前景的解决方案,它鼓励权重重用,有效减少内存使用且性能下降较少。然而,当前的权重共享技术主要关注BERT等小规模模型,并采用粗粒度的共享规则,例如逐层共享。鉴于LLM的普及,这变得具有局限性,共享整个层或块显然降低了权重共享的灵活性。在本文中,我们提出了面向大语言模型的逐头可共享注意力的视角。我们进一步提出了两种内存高效的方法,在注意力头之间共享参数,特别关注LLM。两者都使用相同的动态策略来选择共享权重矩阵。第一种方法直接重用预训练权重而无需重新训练,记为DirectShare\textbf{DirectShare}。第二种方法首先在权重矩阵相似性约束下进行后训练,然后共享,记为PostShare\textbf{PostShare}。实验结果表明,我们的逐头共享模型仍然保持令人满意的能力,证明了细粒度权重共享应用于LLM的可行性。

关键词

引用

@article{arxiv.2402.11819,
  title  = {Head-wise Shareable Attention for Large Language Models},
  author = {Zouying Cao and Yifei Yang and Hai Zhao},
  journal= {arXiv preprint arXiv:2402.11819},
  year   = {2024}
}

备注

17 pages, 7 figures, 21 tables, EMNLP'24 Findings