中文

CompeteSMoE——通过竞争实现稀疏混合专家的有效训练

机器学习 2024-02-06 v1

摘要

稀疏混合专家 (SMoE) 提供了一种有吸引力的解决方案,可在不依赖增加网络深度或宽度的情况下扩展模型复杂度。然而,由于表示崩溃问题会导致参数冗余和有限的表示潜力,SMoE 的有效训练已被证明具有挑战性。在这项工作中,我们提出了一种竞争机制来解决表示崩溃这一根本挑战。通过仅将输入路由到具有最高神经响应的专家,我们证明了在温和的假设下,竞争享有与最优估计器相同的收敛率。我们进一步提出了 CompeteSMoE,这是一种通过部署预测竞争结果的简单路由器来训练大型语言模型的有效且高效的算法。因此,CompeteSMoE 享有竞争路由策略带来的强大性能提升,同时具有较低的计算开销。我们在两种 Transformer 架构和广泛任务上的大量实证评估表明,与最先进的 SMoE 策略相比,CompeteSMoE 具有有效性、鲁棒性和可扩展性。

关键词

引用

@article{arxiv.2402.02526,
  title  = {CompeteSMoE -- Effective Training of Sparse Mixture of Experts via Competition},
  author = {Quang Pham and Giang Do and Huy Nguyen and TrungTin Nguyen and Chenghao Liu and Mina Sartipi and Binh T. Nguyen and Savitha Ramasamy and Xiaoli Li and Steven Hoi and Nhat Ho},
  journal= {arXiv preprint arXiv:2402.02526},
  year   = {2024}
}