LLMs如何利用其深度?
计算与语言
2026-03-03 v2 人工智能
摘要
越来越多的证据表明大语言模型并非均匀地使用其深度,但我们仍然缺乏对其逐层预测动力学的细粒度理解。在本文中,我们追踪了几个开放权重模型在推理过程中的中间表示,揭示了深度使用的结构化和细微特征。具体而言,我们提出了一个"猜测-然后-精炼"框架,解释LLMs如何内部组织其计算以做出预测。我们首先表明,LLM早期层中的最高排名预测主要由高频token组成,它们充当模型由于缺乏上下文信息而提出的统计猜测。随着上下文信息在模型中更深入地发展,这些初始猜测被精炼为上下文适当的token。然后我们通过三个案例研究考察层深度的动态使用。(i)多选题任务分析表明,模型在模型的前半部分识别适当选项,并在后半部分最终确定响应。(ii)事实回忆任务分析表明,在多token答案中,第一个token需要比其余部分更多的计算深度。(iii)词性分析表明,功能词平均来说是最早被正确预测的。为了验证我们的结果,我们补充了基于探针的分析,以激活修补和提前退出实验的形式进行因果操作。一起,我们的结果提供了LLM深度使用的详细视图,揭示了成功预测背后的逐层计算,并为未来工作提高基于Transformer模型的计算效率提供了见解。
引用
@article{arxiv.2510.18871,
title = {How Do LLMs Use Their Depth?},
author = {Akshat Gupta and Jay Yeung and Gopala Anumanchipalli and Anna Ivanova},
journal= {arXiv preprint arXiv:2510.18871},
year = {2026}
}