中文

MiLo:结合低秩补偿器的高效量化混合专家推理

机器学习 2025-04-08 v2

摘要

大规模参数的混合专家 (MoE) 模型部署的关键方法之一是量化。然而,现有最先进的 MoE 模型在极端量化(如低于4位)时会出现显著的精度损失。为此,我们引入 MiLo,一种通过混合低秩补偿器来增强高度量化的 MoE 的新方法。这些补偿器仅占用少量额外内存,却能显著恢复因极端量化导致的精度损失。MiLo 还指出 MoE 模型因其混合稠密稀疏架构而在权重上表现出独特特征,采用自适应秩选择策略以及迭代优化,以缩小精度差距。MiLo 不依赖校准数据,能够针对不同 MoE 模型和数据集进行泛化,而不会对校准集过拟合。为避免极端量化(如3位)带来的硬件效率问题,MiLo 开发了面向 Tensor Core 的 3 位内核,使其在 3 位量化 MoE 模型上实现了测量的延迟加速。我们的评估显示,MiLo 在各种任务上的 SoTA MoE 模型上 outperform 现有方法。

关键词

引用

@article{arxiv.2504.02658,
  title  = {MiLo: Efficient Quantized MoE Inference with Mixture of Low-Rank Compensators},
  author = {Beichen Huang and Yueming Yuan and Zelei Shao and Minjia Zhang},
  journal= {arXiv preprint arXiv:2504.02658},
  year   = {2025}
}