中文

ParetoQ:极端低位LLM量化中的比例理想律

机器学习 2025-10-15 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

实现量化模型规模与精度之间最佳权衡的最佳比特宽度长期以来是争议的话题。虽然一些人主张采用4位量化,但另一些人则认为1.58位量化效果更佳。然而,由于缺乏针对不同比特宽度的统一框架,这些结论仍显得牵强。我们提出ParetoQ——首个实现跨1位、1.58位、2位、3位和4位量化设置严格比较的统一框架。我们的发现表明,在2位和3位之间存在显著的学习转变:对于3位及以上,微调后的模型接近其原始预训练分布;而对于学习2位以下网络,表征会发生剧烈变化。通过优化训练方案并改进量化函数,ParetoQ超越了面向特定比特宽度的先前方法。值得注意的是,我们的ParetoQ异构6000万参数模型甚至在准确率上超过了之前的SOTA异构30亿参数模型,仅使用五分之一的参数。广泛的实验表明,异构、2位和3位量化在规模-精度权衡方面表现相当,通常优于4位和二值化量化。考虑到硬件限制,2位量化在内存降低和加速方面具有潜在优势。

关键词

引用

@article{arxiv.2502.02631,
  title  = {ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization},
  author = {Zechun Liu and Changsheng Zhao and Hanxian Huang and Sijia Chen and Jing Zhang and Jiawei Zhao and Scott Roy and Lisa Jin and Yunyang Xiong and Yangyang Shi and Lin Xiao and Yuandong Tian and Bilge Soran and Raghuraman Krishnamoorthi and Tijmen Blankevoort and Vikas Chandra},
  journal= {arXiv preprint arXiv:2502.02631},
  year   = {2025}
}

备注

NeurIPS 2025. Model weights are available at https://huggingface.co/collections/facebook/mobilellm-6722be18cb86c20ebe113e95