中文

大型语言模型的有效深度受哪些因素影响?

计算与语言 2025-12-17 v1

摘要

大型语言模型(LLM)的规模化强调增加深度,但随着层数的增加,性能提升会逐渐减缓。先前工作引入了'有效深度'的概念,认为更深的模型未能充分利用其各层进行有意义的计算。基于此,我们系统性地研究了有效深度随模型规模、训练类型和任务难度的变化情况。首先,我们分析了Qwen-2.5系列(1.5B-32B)的模型行为,发现虽然有效层数随模型规模增长,但有效深度比例保持稳定。此外,与相应的长CoT模型比较发现,有效深度未增加,这表明改进的推理来源于更长的上下文,而非每个标记的更深计算。进一步地,对不同难度的任务进行评估表明,模型未能针对更难的问题动态地使用更多层。我们的结果表明,当前LLM在各种规模、训练范式和不同难度的任务下,都未能充分利用可用深度,这指向了提高LLM层利用率、模型剪枝和早期退出等研究机会。我们的代码已发布于 https://github.com/AheadOFpotato/what_affects_effective_depth。

关键词

引用

@article{arxiv.2512.14064,
  title  = {What Affects the Effective Depth of Large Language Models?},
  author = {Yi Hu and Cai Zhou and Muhan Zhang},
  journal= {arXiv preprint arXiv:2512.14064},
  year   = {2025}
}