异常值抑制:推进低比特 Transformer 语言模型的极限
机器学习
2023-02-22 v3
摘要
Transformer 架构已成为广泛自然语言处理(NLP)模型的基础要素。随着大 NLP 模型趋势,日益增长的内存与计算成本阻碍其在资源受限设备上的高效部署。因此,Transformer 量化引来广泛研究兴趣。近期工作认识到结构化异常值是量化性能的关键瓶颈。然而,其提出的方法增加了计算开销且仍留下异常值。为从根本上解决该问题,本文深入探究异常值的固有诱因与重要性。我们发现 LayerNorm(LN)中的 充当异常值的罪魁放大器,且异常值的重要性差异巨大,其中少数 token 提供的部分异常值覆盖大面积却可被急剧截断而无负面影响。受这些发现启发,我们提出包含两组件的异常值抑制框架:Gamma 迁移与 Token 级截断。Gamma 迁移以等价变换将异常值放大器迁移至后续模块,促成更量化友好的模型而无任何额外负担。Token 级截断利用 token 范围的大方差,设计 token 级由粗到细流程,以高效方式获得具最小最终量化损失的截断范围。该框架有效抑制异常值且可以即插即用模式使用。大量实验证明我们的框架超越现有工作,并首次将 6 比特训练后 BERT 量化推至全精度(FP)水平。我们的代码见于 https://github.com/wimh966/outlier_suppression。
引用
@article{arxiv.2209.13325,
title = {Outlier Suppression: Pushing the Limit of Low-bit Transformer Language Models},
author = {Xiuying Wei and Yunchen Zhang and Xiangguo Zhang and Ruihao Gong and Shanghang Zhang and Qi Zhang and Fengwei Yu and Xianglong Liu},
journal= {arXiv preprint arXiv:2209.13325},
year = {2023}
}
备注
Accepted by NeurIPS (spotlight) 2022