MoBiE:训练后量化下二值专家混合模型的高效推理
摘要
基于专家混合的 大语言模型 提供了强劲的性能,但承受着高昂的内存和计算成本。权重二值化提供了极致的效率,然而现有面向稠密 的二值方法在处理专家混合 特有问题时面临困难,包括跨专家冗余、任务无关的重要性估计以及量化引起的路由偏移。为此,我们提出了 MoBiE,这是首个专为基于专家混合的 大语言模型 设计的二值化框架。MoBiE 建立在三个核心创新之上:1. 使用联合 SVD 分解来减少跨专家冗余;2. 将全局损失梯度整合到局部海森矩阵度量中以增强权重重要性估计;3. 引入由输入零空间引导的误差约束以缓解路由失真。值得注意的是,MoBiE 在不产生额外存储开销的情况下实现了这些优化,在效率与模型性能之间取得了平衡。广泛的实验表明,MoBiE 在多个基于专家混合的 大语言模型 和基准测试上持续优于最先进的二值方法。例如,在 Qwen3-30B-A3B 上,MoBiE 将困惑度降低了 52.2%,平均零样本性能提升了 43.4%,实现了超过 2 倍的推理加速,并进一步缩短了量化时间。代码可在 https://github.com/Kishon-zzx/MoBiE 获取。
引用
@article{arxiv.2604.06798,
title = {MoBiE: Efficient Inference of Mixture of Binary Experts under Post-Training Quantization},
author = {Zhixiong Zhao and Zukang Xu and Zhixuan Chen and Dawei Yang},
journal= {arXiv preprint arXiv:2604.06798},
year = {2026}
}
备注
Although previously revised, per strict university regulations regarding incorrect affiliation, I am unauthorized to retain this manuscript. Furthermore, fundamental derivation errors in the NGES section compromise the mathematical framework, alongside misleading overlapping wording. The paper is therefore withdrawn