中文

EAQuant:通过专家感知优化提升混合专家模型后训练量化

计算与语言 2026-02-03 v3

摘要

混合专家(MoE)模型通过稀疏专家激活和动态路由实现大规模深度学习中的可扩展计算与性能,但面临量化挑战。现有后训练量化(PTQ)方法未能解决激活异常值、路由不稳定和稀疏专家校准问题,导致显著性能下降。为此,我们提出了EAQuant,一种针对MoE架构的PTQ框架。该方法引入三项专家感知创新:(1)平滑聚合抑制激活异常值,(2)路由一致性对齐保留量化后专家选择,(3)校准数据平衡优化稀疏激活专家。这些策略在超低位限制下共同实现了MoE模型的稳健、高精度量化。在多种极端量化设置(如W4A4/W3A4/W3A3/W2A4)下进行大规模实验表明,EAQuant显著优于现有方法,在三个多样化MoE架构上实现1.15%至13.81%的平均准确率提升,尤其在推理任务中取得显著 gains,并在激进量化下保持稳健性能。通过集成这些创新,EAQuant建立了高精度、高效MoE模型压缩的新型态最佳。我们的代码已公开于https://github.com/darren-fzq1/EAQuant。

关键词

引用

@article{arxiv.2506.13329,
  title  = {EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization},
  author = {Zhongqian Fu and Tianyi Zhao and Ning Ding and Xianzhi Yu and Xiaosong Li and Yehui Tang and Yunhe Wang},
  journal= {arXiv preprint arXiv:2506.13329},
  year   = {2026}
}