中文

ADEPT:面向 Transformer 的自适应动态早退出进程

计算与语言 2026-01-08 v1 人工智能

摘要

大型语言模型的推理施加着巨大的计算负载,常需处理数十亿参数。虽然早退出策略通过在生成阶段仅处理第一个 token 或在预填阶段仅处理提示级别来有效减少计算需求,但被跳过层的 Key-Value(KV)缓存仍是后续 token 生成的瓶颈,限制了早退出的效益。我们提出 ADEPT(Adaptive Dynamic Early-exit Process for Transformers),一种新方法,旨在克服此问题,使预填和生成阶段均能实现动态早退出。该方法采用基于 token 复杂度的自适应 token 级早退出机制,在不损害性能的前提下优化效率。ADEPT 进一步通过解耦跳过层中的顺序依赖,增强了 KV 生成程序,使 token 级早退出更为实用。实验结果表明,ADEPT 在语言生成任务中效率提升最高可达 25%,在下游分类任务中实现 4 倍加速,性能提升最高可达 45%。

关键词

引用

@article{arxiv.2601.03700,
  title  = {ADEPT: Adaptive Dynamic Early-Exit Process for Transformers},
  author = {Sangmin Yoo and Srikanth Malla and Chiho Choi and Wei D. Lu and Joon Hee Choi},
  journal= {arXiv preprint arXiv:2601.03700},
  year   = {2026}
}

备注

11 figures, 8 tables, 22 pages