中文

更深层次的不有效性:对 LLM 权重中知识存储方式的研究

计算与语言 2025-03-04 v2 机器学习 机器学习

摘要

我们如何存储 LLM 权重中的知识?我们通过层级剪枝来研究这一问题:如果删除某一层不会影响模型在常见问答基准测试中的性能,则该层的权重对于存储回答这些问题所需的知识并非必需。为找到这些不必要的参数,我们通过考虑层间相似性来识别要剪枝的最优层块;为“修复”损伤,我们进行少量微调。令人惊讶的是,通过此方法,我们发现直至大量分层 (最高可达一半) 被删除后,模型性能才会出现显著下降。从科学角度看,这些 LLM 对层级删除的鲁棒性意味着要么当前的预训练方法未能充分利用网络更深层次的参数,要么浅层网络在存储知识方面发挥着关键作用。本研究我们使用参数高效微调 (PEFT) 方法,具体包括量化和低秩适配器 (QLoRA),确保每个实验都可以在单块 40GB A100 GPU 上完成。

关键词

引用

@article{arxiv.2403.17887,
  title  = {The Unreasonable Ineffectiveness of the Deeper Layers},
  author = {Andrey Gromov and Kushal Tirumala and Hassan Shapourian and Paolo Glorioso and Daniel A. Roberts},
  journal= {arXiv preprint arXiv:2403.17887},
  year   = {2025}
}

备注

10 + 14 pages, 6 + 5 figures. v2: ICLR camera-ready version; additional experiments in an extended discussion