中文

稀疏专家混合模型中的专家合并:基于诺亚议价的 Nash 议价专家合并

机器学习 2025-10-21 v1 机器学习

摘要

现有的稀疏专家混合模型(SMoE)专家合并策略通常依赖于输入依赖或输入独立的参数平均,但常缺乏原则化的加权机制。本文通过博弈论的视角重新诠释专家合并,揭示专家之间合作与竞争的动态。基于此视角,我们引入 Nash 议价专家合并(NAMEx)一种新框架,将诺亚议价纳入合并过程,实现专家间更均衡、更高效的协作。此外,我们在 NAMEx 中引入复杂动量,以加速专家传播并提供收敛性理论保证。广泛的实验在语言模型、文本分类、图像分类以及数据损坏下的零样本鲁棒性方面表明,NAMEx 在所有测试环境中均一致优于对手方法,并能无缝集成到流行的 MoE 架构中。最后,我们在大规模系统中验证了 NAMEx 的可扩展性,包括 Qwen1.5-MoE(14B)和 DeepSeek-MoE(16B),在零样本和微调设置下均证明其有效。

关键词

引用

@article{arxiv.2510.16138,
  title  = {Expert Merging in Sparse Mixture of Experts with Nash Bargaining},
  author = {Dung V. Nguyen and Anh T. Nguyen and Minh H. Nguyen and Luc Q. Nguyen and Shiqi Jiang and Ethan Fetaya and Linh Duy Tran and Gal Chechik and Tan M. Nguyen},
  journal= {arXiv preprint arXiv:2510.16138},
  year   = {2025}
}

备注

10 pages in the main text. Under Review