中文

残差连接对 Transformer 量化的影响

机器学习 2026-05-26 v1

摘要

大规模 Transformer 的训练和部署日益受限于跨加速器器件传递激活值、梯度和优化器状态。低位量化提供了一种自然的解决方案,但 Transformer 激活值常呈重尾分布且异常值占主导,导致简单量化代价巨大。我们指出,这一困难不仅是量化器的属性,更是网络架构的属性。具体而言,残差连接会在训练过程中将 Transformer 激活值从高斯分布偏离。通过在残差和无残差 Transformer 之间进行受控比较,我们展示了这一效应导致残差模型在低精度下的量化误差和精度下降显著更大。我们通过超值峰度分析解释了这一现象,表明残差混合会放大非高斯性,而无残差的稠密混合则收敛非高斯性。我们随后表明,利用正交初始化、谱或二阶优化,以及注意力温度的深度感知缩放,可使无残差 Transformer 具备可训练性。在语言任务中,尽管全精度性能略有下降,这些模型保持近似高斯激活,并在低位量化方面表现出显著更好的鲁棒性。我们的结果识别了 Transformer 设计中的精度-压缩性权衡,并激发了面向量化友好型基础模型的架构层方法。

关键词

引用

@article{arxiv.2605.25880,
  title  = {The Quantization Benefits of Residual-Free Transformers},
  author = {Yiping Ji and Mahalakshmi Sabanayagam and Peyman Moghadam and Hemanth Saratchandran and Simon Lucey},
  journal= {arXiv preprint arXiv:2605.25880},
  year   = {2026}
}

备注

Under review