现代 LLM 中早期退出解码的效用递减
计算与语言
2026-03-26 v1 人工智能
摘要
在大语言模型(Large Language Model, LLM)推理中,早期退出指的是在预测足够确定后,在中间层停止计算,从而降低延迟和成本。然而,近期 LLM 采用改进的预训练配方和架构,这些改进减少了层冗余,可能限制了早期退出的机会。我们重新评估现代 LLM 中的层级早期退出,并分析中间表示在训练期间的演变方式。我们引入一种度量标准,用于量化模型内在的早期退出适合性,并提出一个基准,供研究人员在不同模型和工作负载上探索潜在的早期退出收益。我们的结果显示,随着模型代际的不断推进,早期退出效果呈递减趋势。我们进一步发现,密集变压器通常比混合专家模型(Mixture-of-Experts)和状态空间模型(State Space Models)具有更大的早期退出潜力。此外,参数数量超过 200 亿的参数的更大模型,以及没有专门调优的基础预训练模型,往往表现出更高的早期退出潜力。
引用
@article{arxiv.2603.23701,
title = {The Diminishing Returns of Early-Exit Decoding in Modern LLMs},
author = {Rui Wei and Rui Du and Hanfei Yu and Devesh Tiwari and Jian Li and Zhaozhuo Xu and Hao Wang},
journal= {arXiv preprint arXiv:2603.23701},
year = {2026}
}