分片 Wasserstein 分布对齐损失提升大语言模型超低位量化效果
机器学习
2026-01-14 v1 人工智能
计算与语言
摘要
大语言模型的大多数优势都伴随着在部署过程中因资源使用不够高效而产生的高额且往往隐藏的经济和环境成本。模型量化通过将模型参数表示为低精度值来提高能源和内存效率。然而,低于 4 位的压缩常常扭曲激活分布并降低性能。我们通过引入用于分布感知校准的分片 Wasserstein 损失函数,以应对此挑战,实现超低位后训练量化。该提议的损失函数在随机线性投影下对齐全精度和量化模型的输出分布,补充标准的均方误差损失,却不增加推理期间的任何计算开销。我们提议的损失函数可以与任何具有重新训练组件的后训练量化框架集成。我们通过将其与两种被认为是前沿方法的 OmniQuant 和 TesseraQ 集成,展示了提议模型的性能提升。与这两种基线方法相比,提议的损失在多种超低位设置下 consistently improved perplexity 和下游任务准确率。我们提议的损失函数恢复了 OmniQuant 丢失的准确率的 4.12-20.37%,OPT-6.7B 上为 0.93-7.65%,LLaMA-2-13B 上为 2.26-6.20%。TesseraQ 的准确率下降通过我们提议的损失函数恢复了 3.63-7.63% 的相对术语。综上,这些结果表明,分布对齐提供了一个简单而有效的性能提升,可推动前沿量化方法的极限。我们的方法已在 GitHub 上提供,以促进超低位量化领域的未来进展。
关键词
引用
@article{arxiv.2601.07878,
title = {Sliced-Wasserstein Distribution Alignment Loss Improves the Ultra-Low-Bit Quantization of Large Language Models},
author = {Deyu Cao and Yixin Yin and Samin Aref},
journal= {arXiv preprint arXiv:2601.07878},
year = {2026}
}
备注
Post-peer-review accepted manuscript, 17 pages including the supplementary information