锦上添花:大型语言模型中的参数异质性与量化
计算与语言
2024-12-02 v2
摘要
本文揭示了大型语言模型 (LLM) 中参数异质性的现象。我们发现,一小部分“核心”参数对模型性能表现出不成比例的巨大影响,而绝大多数参数的影响微乎其微。这种异质性在不同的模型家族、规模和类型中普遍存在。受此观察启发,我们提出了 CherryQ,一种统一混合精度参数优化的新型量化方法。CherryQ 识别并以高精度保留关键的核心参数,同时将其余参数激进地量化至低精度。大量实验证明了 CherryQ 的有效性。在困惑度和下游任务性能方面,CherryQ 优于现有的量化方法。值得注意的是,我们的 3-bit 量化 Vicuna-1.5 与其 16-bit 对应模型相比表现出有竞争力的性能。
引用
@article{arxiv.2404.02837,
title = {Cherry on Top: Parameter Heterogeneity and Quantization in Large Language Models},
author = {Wanyun Cui and Qianle Wang},
journal= {arXiv preprint arXiv:2404.02837},
year = {2024}
}