在混合专家调优中保持长尾专家信息
机器学习
2026-04-28 v1 计算与语言
摘要
尽管 MoE 模型在众多基准测试中领先,但针对 MoE 架构的监督微调(SFT)仍然具有困难性,因为其路由器层面临脆弱性。DenseMixer 和 ESFT 等方法通过稠密混合或辅助负载平衡损失来缓解路由器崩溃,但这些会引入噪声梯度,常常降低性能。在初步实验中,我们系统性地修剪了专家,发现虽然某些超级专家被激活频率更高,但丢弃使用较少的专家仍会导致显著的性能下降。这表明即使是稍少被激活的专家也编码了对下游任务有用的非平凡知识。基于此,我们提出一种无需辅助损失的 MoE SFT 框架,结合 bias-driven 稀疏化与始终活跃的门控 condenser 专家。与强制所有专家均衡激活不同,我们的方法鼓励与任务相关的专家保持活跃,同时将长尾专家推向非活跃状态。Censer 专家提供了一个持久、可学习的通道,缓解了梯度饥饿现象,促进了否则会稀疏激活专家中碎片化信息的整合。进一步分析表明,这种设计在稀疏路由下更好地保留了长尾专家信息。在大规模 MoE 模型上的实验表明,我们的方法在数学推理和 commonsenseQA 等 SOTA 基准上均超越了 DenseMixer 和 ESFT,平均提升 2.5% 以上。
引用
@article{arxiv.2604.23036,
title = {Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning},
author = {Haoze He and Xingyuan Ding and Xuan Jiang and Xinkai Zou and Alex Cheng and Yibo Zhao and Juncheng Billy Li and Heather Miller},
journal= {arXiv preprint arXiv:2604.23036},
year = {2026}
}
备注
36 pages