中文

CodeQuant:用于增强低精度混合专家模型中离群值平滑的统一聚类与量化

机器学习 2026-04-14 v1

摘要

离群值已成为在低精度大型模型中保持准确性的根本瓶颈,尤其是在日益成为大规模语言建模核心的混合专家(Mixture-of-Experts, MoE)架构中。在后训练量化(PTQ)下,这些离群值导致显著的量化误差,引发严重的准确性下降。虽然最近的旋转平滑技术通过重新分配离群值幅度来缓解此问题,但残余误差仍然存在并继续阻碍可靠的低精度部署。本文通过引入包含平滑激活离群值(通过可学习旋转实现)和吸收权重离群值至微调聚类质心的统一量化-聚类方案(称为CodeQuant)来解决此挑战。该设计通过拟合离群值于聚类质心内,降低其影响,从而降低量化误差并保持表达能力。结合针对GPU和CPU的专用内核设计,CodeQuant在多样化的MoE模型上实现了最高可达4.15×4.15\times的加速,并显著高于当前最先进的量化方法。我们的结果表明,CodeQuant是大语言模型在低精度约束下实现高效准确部署的有前景的方向。我们的代码已在https://github.com/SAI-Lab-NYU/CodeQuant提供。

关键词

引用

@article{arxiv.2604.10496,
  title  = {CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts},
  author = {Xiangyang Yin and Xingyu Liu and Tianhua Xia and Bo Bao and Vithursan Thangarasa and Valavan Manohararajah and Eric Sather and Sai Qian Zhang},
  journal= {arXiv preprint arXiv:2604.10496},
  year   = {2026}
}