中文

锦上添花:大型语言模型中的参数异质性与量化

计算与语言 2024-12-02 v2

摘要

本文揭示了大型语言模型 (LLM) 中参数异质性的现象。我们发现,一小部分“核心”参数对模型性能表现出不成比例的巨大影响,而绝大多数参数的影响微乎其微。这种异质性在不同的模型家族、规模和类型中普遍存在。受此观察启发,我们提出了 CherryQ,一种统一混合精度参数优化的新型量化方法。CherryQ 识别并以高精度保留关键的核心参数,同时将其余参数激进地量化至低精度。大量实验证明了 CherryQ 的有效性。在困惑度和下游任务性能方面,CherryQ 优于现有的量化方法。值得注意的是,我们的 3-bit 量化 Vicuna-1.5 与其 16-bit 对应模型相比表现出有竞争力的性能。

关键词

引用

@article{arxiv.2404.02837,
  title  = {Cherry on Top: Parameter Heterogeneity and Quantization in Large Language Models},
  author = {Wanyun Cui and Qianle Wang},
  journal= {arXiv preprint arXiv:2404.02837},
  year   = {2024}
}