中文

LEAP:面向高效 Transformer 推理的分层退出感知预训练

机器学习 2026-05-05 v1 人工智能 计算与语言

摘要

层级对齐蒸馏和基于收敛的早期退出是 Transformer 推理中两种主要的计算效率范式;然而我们指出,这两种方法在标准部署条件下存在系统性不兼容性。那些将中间学生层对齐到教师表示的蒸馏目标会抑制早期退出机制所依赖的表征收敛,从而使此类机制在蒸馏模型上失效。我们提出 LEAP(Layer-wise Exit-Aware Pretraining),一种兼容性辅助训练目标。LEAP 无需架构修改;它在标准蒸馏基础上增添一个单一约束,确保中间层近似最终层的表示。LEAP-MiniLM 在 θ=0.95 时实现 1.61 倍实际墙钟加速(batch=1,NVIDIA L4),91.9% 的样本在第 7 层即可退出,实现 1.80 倍的理论层级减减,标准蒸馏模型实现零有效加速。我们在句子相似性(STS-B: 0.760 ± 0.006)和检索基准(BEIR)上进行验证,提供运行指导,包括延迟测量、决策阈值和部署准则。

关键词

引用

@article{arxiv.2605.01058,
  title  = {LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference},
  author = {Shashank Kapadia and Deep Naryan Mishra and Sujal Reddy Alugubelli and Haoan Wang and Saipraveen Vabbilisetty and Rishi Bhatia and Anupriya Sharma},
  journal= {arXiv preprint arXiv:2605.01058},
  year   = {2026}
}

备注

Accepted at ACL 2026 (Industry Track). 14 pages, 5 figures