探索权衡:从边缘到巨量级大语言模型的量化方法、任务难度与模型规模
计算与语言
2025-06-05 v6 人工智能
摘要
量化作为一种有前景的解决方案,已引起关注,用于经济高效地部署大规模和小规模语言模型。然而,大多数先前工作局限于困惑度或基础知识任务,缺乏对Llama-3.3等近期模型的全面评估。在本文中,我们对参数规模从1B到405B的指令微调模型进行了全面评估,在13个数据集上应用了四种量化方法。我们的发现表明:(1) 量化模型通常优于较小的FP16基线,但它们在指令遵循和幻觉检测方面常常表现不佳;(2) FP8始终是跨任务最稳健的选择,而AWQ在仅权重量化中往往优于GPTQ;(3) 较小的模型在4比特量化时可能遭受严重的精度下降,而70B规模的模型则保持稳定性能;(4) 值得注意的是,\textit{困难}任务并不总是经历最大的精度损失,这表明量化放大了模型固有的弱点,而非简单地与任务难度相关;(5) 基于LLM的评判器(MT-Bench)突显了在编程和STEM任务中的显著性能下降,尽管它偶尔会报告推理方面的改进。
引用
@article{arxiv.2409.11055,
title = {Exploring the Trade-Offs: Quantization Methods, Task Difficulty, and Model Size in Large Language Models From Edge to Giant},
author = {Jemin Lee and Sihyeong Park and Jinse Kwon and Jihun Oh and Yongin Kwon},
journal= {arXiv preprint arXiv:2409.11055},
year = {2025}
}
备注
Accepted in IJCAI 2025, 21 pages, 2 figure