探究大型语言模型中的层重要性
计算与语言
2024-09-24 v1 机器学习
摘要
大型语言模型 (LLM) 因其理解和处理文本的卓越能力而受到越来越多的关注。然而,LLM 在很大程度上仍然是不透明的。对 LLM 缺乏理解阻碍了其在安全关键场景中的部署,并妨碍了更好模型的开发。在本研究中,我们通过探究 LLM 中各单独层的重要性来增进对 LLM 的理解。我们提出了一种高效的采样方法,利用 Shapley 值(一种在特征归因和数据评估中广泛使用的解释框架)来忠实地评估层的重要性。此外,我们进行了层消融实验,以评估排除特定层所导致的性能下降。我们的发现揭示了基石层的存在,其中某些早期层对其他层表现出主导性贡献。移除一个基石层会导致模型性能的急剧崩溃,通常使其退化为随机猜测。相反,移除非基石层仅导致微小的性能变化。本研究识别了 LLM 中的基石层,并强调了它们在未来研究中的关键作用。
引用
@article{arxiv.2409.14381,
title = {Investigating Layer Importance in Large Language Models},
author = {Yang Zhang and Yanfei Dong and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2409.14381},
year = {2024}
}