中文

预训练大语言模型的跨层注意力共享

计算与语言 2025-10-20 v2

摘要

为了提升大型语言模型(LLM)中注意力机制的效率,此前的工作主要压缩KV缓存或对注意力头进行分组,而很大程度上忽略了层与层之间的冗余。我们的全面分析表明,在大多数层中持续存在高度相似的注意力模式。通过跨层共享注意力权重来减少这种冗余是直观的。然而,进一步的分析揭示了两个挑战:(1)在不仔细重排注意力头的情况下直接共享权重矩阵是无效的;(2)浅层容易受到注意力权重微小偏差的影响。基于这些洞察,我们提出了LISA,一种用于成熟LLM的自注意力轻量级替代方案。LISA使用小型前馈网络来对齐相邻层之间的注意力头,并使用低秩矩阵来近似层间注意力权重的差异。涵盖13个典型基准的评估表明,LISA在准确性和困惑度方面保持了高响应质量,同时减少了53%-84%总层中的冗余注意力计算。我们的LISA实现实现了注意力机制中Q和K矩阵的6倍压缩,最大吞吐量提升分别为LLaMA3-8B的19.5%、LLaMA2-7B的32.3%和LLaMA2-13B的40.1%。

关键词

引用

@article{arxiv.2408.01890,
  title  = {Cross-layer Attention Sharing for Pre-trained Large Language Models},
  author = {Yongyu Mu and Yuzhang Wu and Yuchun Fan and Chenglong Wang and Hengyu Li and Jiali Zeng and Qiaozhi He and Murun Yang and Fandong Meng and Jie Zhou and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2408.01890},
  year   = {2025}
}

备注

A version accepted by TACL, prior to its publication by MIT Press