中文

学习专精化:面向去中心化场景自适应 MoE 的联合门控-专家训练

机器学习 2025-06-04 v3 人工智能 最优化与控制

摘要

混合专家(MoEs)通过动态激活部分组件实现可扩展性。然而,对于门控机制与专家联合训练如何催生专精化,尤其在无清晰任务划分的场景中,理解仍不完整。受推理成本与数据异质性驱动,我们研究门控函数与专家的联合训练如何跨多个潜在数据分布动态分配领域专属专精能力。作为框架成果,我们开发了专为去中心化训练场景定制的实例,引入 \textit{动态去中心化 MoE 编排}(\texttt{DDOME})。\texttt{DDOME} 利用去中心化数据源间分布偏移涌现的异质性来动态专精化专家。通过集成预训练通用专家以引导门控函数,\texttt{DDOME} 实现按需的个性化专家子集选择,促进即时个性化。我们在联邦学习(FL)语境下实证验证 \texttt{DDOME}:在图像与文本分类任务中,\texttt{DDOME} 相较最先进 FL 基线取得 4% 至 24% 的准确率提升,同时保持具竞争力的零样本泛化能力。此外,我们提供理论洞见,确认联合门控-专家训练对实现有意义的专家专精化至关重要。

关键词

引用

@article{arxiv.2306.08586,
  title  = {Learning to Specialize: Joint Gating-Expert Training for Adaptive MoEs in Decentralized Settings},
  author = {Yehya Farhat and Hamza ElMokhtar Shili and Fangshuo Liao and Chen Dun and Mirian Hipolito Garcia and Guoqing Zheng and Ahmed Hassan Awadallah and Robert Sim and Dimitrios Dimitriadis and Anastasios Kyrillidis},
  journal= {arXiv preprint arXiv:2306.08586},
  year   = {2025}
}

备注

26 Pages