揭示 LLM 各层在检索、知识和推理中的作用
人工智能
2026-01-28 v4
摘要
近期研究表明,大语言模型(LLM)的更深层对表示学习贡献甚微,通常可以在不显著损失性能的情况下移除。然而,此类主张通常来自狭窄的评估,可能忽略模型行为的重要方面。在本工作中,我们对深度利用进行了系统性研究,涵盖多个维度,包括评估协议、任务类别和模型架构。我们的分析确认,极深层通常不如浅层有效,但其贡献随评估设置的不同而差异显著。在不生成文本的基于似然的评估指标下,剪枝大部分层可保持性能,仅初始几层至关重要。相比之下,基于生成的评估揭示了中间层和深层在实现推理和维持长程连贯性方面不可或缺的作用。我们进一步发现,知识和检索集中在浅层组件中,而推理准确性高度依赖深层——但可通过蒸馏重塑。这些结果表明,LLM 中的深度使用具有高度异质性和上下文依赖性,强调了在解释和压缩大型模型时需要考虑任务、评估指标和模型特性的视角。
引用
@article{arxiv.2510.02091,
title = {Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning},
author = {Xinyuan Song and Keyu Wang and PengXiang Li and Lu Yin and Shiwei Liu},
journal= {arXiv preprint arXiv:2510.02091},
year = {2026}
}
备注
Accepted by ICASSP 2026