中文

大型语言模型量化的难点何在?基于扰动视角的实证研究

机器学习 2024-03-12 v1 人工智能

摘要

量化已成为提升大型语言模型(LLM)内存与计算效率的一项极具前景的技术。尽管性能与效率之间的权衡已为人所熟知,但关于量化与 LLM 性能之间的关系仍有待深入探索。为揭示这一关系,我们提出了一种新的量化视角,将其视为添加到 LLM 权重和激活值上的扰动。我们将这种方法称为“扰动视角”。基于这一视角,我们利用各种人工扰动进行实验,以探究其对 LLM 性能的影响。我们的发现揭示了扰动的性质与 LLM 性能之间的若干联系,为均匀量化的失败案例提供了见解,并提出了增强 LLM 量化鲁棒性的潜在解决方案。为展示我们发现的意义,我们基于这些见解实现了一种简单的非均匀量化方法。实验表明,该方法在 4-bit 权重量化以及 8-bit 权重和激活值量化上均实现了最小的性能下降。这些结果验证了我们方法的正确性,并凸显了在不牺牲性能的前提下提升 LLM 效率的潜力。

关键词

引用

@article{arxiv.2403.06408,
  title  = {What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation},
  author = {Zhuocheng Gong and Jiahao Liu and Jingang Wang and Xunliang Cai and Dongyan Zhao and Rui Yan},
  journal= {arXiv preprint arXiv:2403.06408},
  year   = {2024}
}