面向大语言模型的逐头可共享注意力
计算与语言
2024-10-25 v3
摘要
大语言模型(LLM)参数数量庞大,限制了其在边缘设备上的部署。权重共享是一种有前景的解决方案,它鼓励权重重用,有效减少内存使用且性能下降较少。然而,当前的权重共享技术主要关注BERT等小规模模型,并采用粗粒度的共享规则,例如逐层共享。鉴于LLM的普及,这变得具有局限性,共享整个层或块显然降低了权重共享的灵活性。在本文中,我们提出了面向大语言模型的逐头可共享注意力的视角。我们进一步提出了两种内存高效的方法,在注意力头之间共享参数,特别关注LLM。两者都使用相同的动态策略来选择共享权重矩阵。第一种方法直接重用预训练权重而无需重新训练,记为。第二种方法首先在权重矩阵相似性约束下进行后训练,然后共享,记为。实验结果表明,我们的逐头共享模型仍然保持令人满意的能力,证明了细粒度权重共享应用于LLM的可行性。
引用
@article{arxiv.2402.11819,
title = {Head-wise Shareable Attention for Large Language Models},
author = {Zouying Cao and Yifei Yang and Hai Zhao},
journal= {arXiv preprint arXiv:2402.11819},
year = {2024}
}
备注
17 pages, 7 figures, 21 tables, EMNLP'24 Findings