中文

"给我 BF16 或给我死亡"?LLM 量化中的精度-性能权衡

机器学习 2026-05-27 v4 人工智能

摘要

量化是加速大语言模型(LLM)推理的强大工具,但不同格式之间的精度-性能权衡尚不清楚。在本文中,我们进行了迄今为止最全面的实证研究,在整个 Llama-3.1 模型家族上评估了 FP8、INT8 和 INT4 量化,涵盖学术基准和真实任务。通过超过 500,000 次评估,我们的研究得出了若干关键发现:(1)FP8(W8A8-FP)在所有模型规模上基本无损,(2)经过良好调优的 INT8(W8A8-INT)实现了令人惊讶的低(1-3%)精度下降,(3)INT4 仅权重(W4A16-INT)比预期更具竞争力,与 8 位量化不相上下。此外,我们通过流行的 vLLM 框架分析推理性能,探讨了不同部署的最佳量化格式。我们的分析提供了明确的部署建议:W4A16 在同步设置中最具成本效益,而 W8A8 在异步连续批处理中占主导地位。对于混合工作负载,最优选择取决于具体用例。我们的研究结果提供了实用的、数据驱动的指南,用于大规模部署量化 LLM——确保速度、效率和精度之间的最佳平衡。

关键词

引用

@article{arxiv.2411.02355,
  title  = {"Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization},
  author = {Eldar Kurtic and Alexandre Marques and Shubhra Pandit and Mark Kurtz and Dan Alistarh},
  journal= {arXiv preprint arXiv:2411.02355},
  year   = {2026}
}

备注

Accepted to ACL 2025