迈向理解深度学习中的混合专家模型
机器学习
2022-08-05 v1 人工智能
机器学习
摘要
混合专家(MoE)层是一种由路由器控制的稀疏激活模型,在深度学习中取得了巨大成功。然而,对此种架构的理解仍不明晰。本文中,我们形式化研究MoE层如何提升神经网络学习性能,以及为何混合模型不会坍缩为单一模型。我们的经验结果表明,底层问题的簇结构以及专家的非线性对MoE的成功至关重要。为进一步理解,我们考虑一个具有内在簇结构、难以用单一专家学习的具挑战性分类问题。然而借助MoE层,通过选择两层非线性卷积神经网络(CNNs)作为专家,我们展示该问题可被成功学习。此外,我们的理论表明路由器可学习簇中心特征,从而将输入的复杂问题划分为各个专家可攻克的更简单线性分类子问题。据我们所知,这是朝向形式化理解深度学习MoE层机制的首个结果。
引用
@article{arxiv.2208.02813,
title = {Towards Understanding Mixture of Experts in Deep Learning},
author = {Zixiang Chen and Yihe Deng and Yue Wu and Quanquan Gu and Yuanzhi Li},
journal= {arXiv preprint arXiv:2208.02813},
year = {2022}
}
备注
53 pages, 8 figures, 11 tables