中文

LLM推理的二维早期退出优化

计算与语言 2026-04-22 v1 人工智能

摘要

我们提出一种二维(2D)早期退出策略,用于协调大型语言模型中层级和句子级的退出,以处理分类任务。通过逐句处理输入并逐步激活更深的层,本方法实现了超过独立优化单一维度的乘法计算节省。对四款最先进的LLM(Llama 3.1、Llama 3.2、Gemma、Qwen;参数规模为3B-8B)在三个情感分类数据集上的实验评估显示,在较简单任务上使用基础模型可实现1.4--2.3倍的额外加速,而在复杂多分类问题上则表现出 graceful degradation。微调虽减少了这一优势,但并未消除。该方法具有模型无关性,仅需轻量级分类适配器,且与量化和修剪等互补的效率方法是正交的。我们的发现表明,二维早期退出策略在语义信息在输入结构中可预测地累积时效果最佳,提示其对情感分类之外的序列处理任务可能也有应用前景。

关键词

引用

@article{arxiv.2604.18592,
  title  = {Two-dimensional early exit optimisation of LLM inference},
  author = {Jan Hůla and David Adamczyk and Tomáš Filip and Martin Pavlíček and Petr Sosík},
  journal= {arXiv preprint arXiv:2604.18592},
  year   = {2026}
}