高斯门控专家混合模型参数估计的收敛速率研究
机器学习
2024-02-12 v2 机器学习
摘要
混合专家(MoE)最初作为集成学习的神经网络被提出,近来已成为若干机器学习与统计应用中用于异质数据分析的高度成功现代深度神经网络的基本构件。尽管其在实践中广受欢迎,对 MoE 模型令人满意的理论理解远未完成。为阐明此问题,我们对高斯门控 MoE 模型中的最大似然估计(MLE)给出收敛分析。该分析的主要挑战来自协变量被纳入高斯门控函数与专家网络,这导致它们通过关于参数的某些偏微分方程产生内在交互。我们通过设计参数间新颖的 Voronoi 损失函数来准确刻画参数估计速率的异质性,从而解决这些问题。我们的发现揭示,MLE 在高斯门控函数位置参数的两种互补设定下呈现不同行为:即所有参数均非零 versus 至少一个参数消失。值得注意的是,这些行为可由两个不同多项式方程组的可解性来刻画。最后,我们进行仿真研究以从经验上验证我们的理论结果。
引用
@article{arxiv.2305.07572,
title = {Towards Convergence Rates for Parameter Estimation in Gaussian-gated Mixture of Experts},
author = {Huy Nguyen and TrungTin Nguyen and Khai Nguyen and Nhat Ho},
journal= {arXiv preprint arXiv:2305.07572},
year = {2024}
}
备注
32 pages, 9 figures; Huy Nguyen and TrungTin Nguyen contributed equally to this work