中文

消除GLU基LLM因激活尖峰导致的量化误差

计算与语言 2024-05-24 v1 机器学习

摘要

现代大型语言模型(LLMs)通过架构改进已建立了最先进的性能,但仍需大量计算资源进行推理。为降低推理成本,后训练量化(PTQ)成为流行方法,将权重和激活量化为更低的精度,如INT8。在本文中,我们揭示了GLU变体在激活量化方面的挑战,这些变体广泛用于现代LLMs的前馈网络(FFN),如LLaMA系列。问题在于,由GLU变体激活值过大导致的严重局部量化误差显著降低了量化后LLM的性能。我们将这些激活称为激活尖峰。我们的进一步观察提供了激活尖峰的系统性模式:1) 激活尖峰发生在特定层的FFN中,尤其是早期和后期层;2) 激活尖峰专为少数几个token所需,而非在序列中共享。基于我们的观察,我们提出两种经验方法:量化无感模块(QFeM)和量化无感前缀(QFeP),以在量化期间隔离激活尖峰。我们的广泛实验验证了针对最新GLU变体LLMs(包括LLaMA-2/3、Mistral、Mixtral、SOLAR和Gemma)的激活量化有效性,特别是针对粗粒度方案。特别是,我们的方法增强了当前缓解技术(如SmoothQuant)无法控制激活尖峰的效果。代码已公开于https://github.com/onnoo/activation-spikes。

关键词

引用

@article{arxiv.2405.14428,
  title  = {Mitigating Quantization Errors Due to Activation Spikes in GLU-Based LLMs},
  author = {Jaewoo Yang and Hayun Kim and Younghoon Kim},
  journal= {arXiv preprint arXiv:2405.14428},
  year   = {2024}
}