中文

BitSkip:量化与早期退出在变换模型中的组合实证分析

计算与语言 2026-03-23 v2

摘要

高效大语言模型 (LLM) 的 pursuit 导致采用越来越复杂的技术,如极端量化和动态路由。虽然这些方法的单个优势已广为人知,但其组合效应仍不完全了解。本文引入 BitSkip,一个用于系统性探索这些交互作用的混合架构框架。我们发现,反直觉地,一个简单的 8 位量化模型而无哈达德变换 (BitSkip-V1) 不仅优于其更复杂的 4 位和哈达德增强型后继者,而且与全精度基线在质量上 (perplexity 为 1.13 vs 1.19) 相抗衡。哈达德变换的引入,即便在 8 位精度下,也会在训练中引起灾难性的性能下降,导致性能下降超过 37,000%。我们的方法 BitSkip-V1 在早期退出方面表现优异,第 18 层提供最佳的 32.5% 速度提升,仅带来 4% 的质量损失。

关键词

引用

@article{arxiv.2510.23766,
  title  = {BitSkip: An Empirical Analysis of Quantization and Early Exit Composition in Transformers},
  author = {Ramshankar Bhuvaneswaran and Handan Liu},
  journal= {arXiv preprint arXiv:2510.23766},
  year   = {2026}
}