ShortGPT:大型语言模型的层更冗余 than you expect
计算与语言
2024-10-14 v3
摘要
随着大型语言模型(LLM)在性能方面的持续进步,其规模也显著扩大,当前的 LLM 包含数十亿甚至数万亿参数。然而,在本研究中,我们发现许多 LLM 的层 exhibits high similarity,而 some layers 在网络功能中扮演着微乎其微的角色。基于这一观察,我们定义一种称为 Block Influence(BI) 的指标,用于衡量每个层在 LLM 中的重要性。随后,我们提出一种简单的修剪方法:layer removal,即直接根据 BI 分数删除 LLM 中的冗余层。实验表明,我们称之为 ShortGPT 的该方法显著优于前述 state-of-the-art(SOTA) 方法。此外,ShortGPT 与类量化方法是正交的,可进一步减少参数和计算。通过简单地层移除即可实现更好结果,而无需复杂的修剪技术,表明模型架构中存在高度冗余性。
引用
@article{arxiv.2403.03853,
title = {ShortGPT: Layers in Large Language Models are More Redundant Than You Expect},
author = {Xin Men and Mingyu Xu and Qingyu Zhang and Bingning Wang and Hongyu Lin and Yaojie Lu and Xianpei Han and Weipeng Chen},
journal= {arXiv preprint arXiv:2403.03853},
year = {2024}
}