中文

通过激活正则化消除语言模型量化中异常通道的影响

机器学习 2024-08-28 v2 计算与语言

摘要

我们关注语言模型准确量化的问题,其中权重和激活均均匀量化为每参数 4 位,这是 GPU 硬件原生支持的最低位宽格式。在此情境下,关键挑战在于激活量化:已知语言模型包含异常通道,其值平均比其他通道高出多个数量级,这阻碍了使用已知技术进行低位宽量化。我们系统性地研究了这一现象,发现异常通道在训练早期即出现,且在残差流较多的层中更频繁地出现。我们随后提出一种简单策略,通过量化感知训练(QAT)对层的输入进行正则化,并通过激活峰度正则化对其输出进行正则化。我们表明,对输入和输出都进行正则化对于防止模型在输入量化难度迁移到权重上至关重要,这会使权重的后训练量化(PTQ)更加困难。当与权重 PTQ 结合使用时,我们的方法能够获得一个在准确性上与标准精度 W16A16 基线相当的 W4A4 模型。

关键词

引用

@article{arxiv.2404.03605,
  title  = {Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization},
  author = {Aniruddha Nrusimha and Mayank Mishra and Naigang Wang and Dan Alistarh and Rameswar Panda and Yoon Kim},
  journal= {arXiv preprint arXiv:2404.03605},
  year   = {2024}
}