中文

量化大语言模型中是否存在涌现能力:一项实证研究

计算与语言 2023-07-27 v2 人工智能

摘要

尽管性能优越,大语言模型(LLMs)的部署和使用仍需大量计算资源。为克服该问题,量化方法已被广泛应用于减小LLMs的内存占用并提升推理速度。然而,一个主要挑战是低比特量化方法常导致性能下降。理解量化如何影响LLMs的能力十分重要。与以往关注整体性能的研究不同,本工作旨在研究量化对\emph{涌现能力}的影响,涌现能力是区分LLMs与小语言模型的重要特征。具体地,我们考察了量化LLMs中上下文学习、思维链推理和指令跟随的能力。我们的实证实验表明,这些涌现能力在4-bit量化模型中仍然存在,而2-bit模型在这些能力测试上遭遇严重性能下降。为提升低比特模型性能,我们进行了两项专门实验:(1)研究哪些组件(或子结构)对量化更敏感的细粒度影响分析;(2)通过模型微调进行性能补偿。我们的工作得出了一系列理解量化对涌现能力影响的重要发现,并为LLMs极致低比特量化的可能性提供了启示。

关键词

引用

@article{arxiv.2307.08072,
  title  = {Do Emergent Abilities Exist in Quantized Large Language Models: An Empirical Study},
  author = {Peiyu Liu and Zikang Liu and Ze-Feng Gao and Dawei Gao and Wayne Xin Zhao and Yaliang Li and Bolin Ding and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2307.08072},
  year   = {2023}
}

备注

15 pages, 4 figures