K 量化及其对输出性能的影响
计算与语言
2026-05-20 v1
摘要
最近的大型语言模型 (LLM) 进展显示其在众多 NLP 任务中具有卓越的能力。然而,其巨大的规模常常给部署带来挑战。这 necessitates 对模型压缩的高效技术,其中量化 (quantization) 作为主要解决方案。尽管量化带来诸多好处,但从 2 位到 6 位的量化对 LLM 的性能和准确性产生的确切影响仍是活跃的研究领域。本文考察了八个 LLM 在 various quantization levels 上的性能,聚焦于 MMLU-Pro 知识处理与推理、CRUXEval 代码理解以及 MuSR 阅读理解等任务。我们的结果显示,更高精度(例如 8 位 Q8\_0)能获得更好的性能,尽管收益有所递减。激进量化(例如 2 位 Q2\_K)通常能保持可接受的准确性,尽管一些模型在性能上会出现显著损失。我们的发现表明,虽然更低的位精度通常会降低性能,但影响在不同模型和任务之间呈现差异。较大的模型对激进量化具有更大的韧性,但在更低精度水平下仍可能出现显著的性能下降。参数在 7-9 十亻范围内的中等规模模型在效率和资源使用之间达到最佳平衡。这些结果为模型规模、量化与性能之间的权衡提供了见解。
引用
@article{arxiv.2605.19645,
title = {K-Quantization and its Impact on Output Performance},
author = {Robin Baki Davidsson and Pierre Nugues},
journal= {arXiv preprint arXiv:2605.19645},
year = {2026}
}
备注
13 pages, 4 figures