Qwen3量化实证研究
机器学习
2025-05-06 v1
摘要
Qwen系列已成为领先的开源大型语言模型(LLM)家族,在自然语言理解任务中展现出卓越的能力。随着近期Qwen3的发布,其在多种基准测试中表现出优越性能,人们越来越关注如何在资源受限的环境中高效部署这些模型。低位量化提供了一种有前景的解决方案,但其对Qwen3性能的影响仍未得到充分探索。本研究对Qwen3在各种量化设置下的稳健性进行了系统评估,旨在揭示压缩这一最先进模型时的机遇与挑战。我们严格评估了应用于Qwen3的5种现有经典训练后量化技术,涵盖1到8比特的位宽,并在多个数据集上评估其有效性。我们的发现表明,虽然Qwen3在中等位宽下保持有竞争力的性能,但在超低精度下,其在语言任务上会经历显著的性能下降,这凸显了LLM压缩中持续存在的障碍。这些结果强调了需要进一步研究以减轻极端量化场景下的性能损失。我们期望这项实证分析能为推进针对Qwen3及未来LLM的量化方法提供可操作的见解,最终在不牺牲准确性的前提下增强其实用性。我们的项目发布于https://github.com/Efficient-ML/Qwen3-Quantization和https://huggingface.co/collections/Efficient-ML/qwen3-quantization-68164450decb1c868788cb2b。
引用
@article{arxiv.2505.02214,
title = {An Empirical Study of Qwen3 Quantization},
author = {Xingyu Zheng and Yuye Li and Haoran Chu and Yue Feng and Xudong Ma and Jie Luo and Jinyang Guo and Haotong Qin and Michele Magno and Xianglong Liu},
journal= {arXiv preprint arXiv:2505.02214},
year = {2025}
}