超越参数数量:软混合专家中的隐式偏差
机器学习
2024-09-04 v1 人工智能
摘要
关于稀疏混合专家(MoE)模型的传统观点是,与其训练一个计算成本高昂的单一大型专家,不如训练许多小型专家。其期望是,如果小型专家的总参数数量等于单一大型专家的参数数量,那么我们在获得计算易处理性和促进专家专业化的同时,保留了大型专家的表示能力。最近引入的 Soft MoE 用一种平滑混合词元的可微门控函数取代了 Sparse MoE 的离散路由机制。虽然这种平滑门控函数成功缓解了与 Sparse MoE 相关的各种训练不稳定性,但尚不清楚它是否引入了影响 Soft MoE 表示能力或专家专业化潜力的隐式偏差。我们证明,具有单个任意强大专家的 Soft MoE 无法表示简单的凸函数。这证明了 Soft MoE 的成功不能用许多小型专家集体模仿单个大型专家表示能力的传统观点来解释,并且多个专家对于实现良好的表示能力实际上是必要的(即使总参数数量固定)。沿着这条研究路线,我们为 Soft MoE 引入了一个专家专业化的概念,并在改变专家数量但固定总参数数量的同时,考虑以下(计算上难以处理的)任务。给定任意输入,我们如何发现专门用于预测该输入标签的专家子集?我们通过实验表明,当存在许多小型专家时,该架构以某种方式隐式地存在偏差,使我们能够有效地近似出专门的专家子集。我们的方法可以轻松实现,以潜在地减少推理过程中的计算量。
引用
@article{arxiv.2409.00879,
title = {Beyond Parameter Count: Implicit Bias in Soft Mixture of Experts},
author = {Youngseog Chung and Dhruv Malik and Jeff Schneider and Yuanzhi Li and Aarti Singh},
journal= {arXiv preprint arXiv:2409.00879},
year = {2024}
}
备注
21 pages, 5 figures, 13 tables