基于混合测度的树状图用于高斯门控高斯混合专家模型的模型选择
机器学习
2025-05-26 v2 机器学习
统计理论
统计计算
统计方法学
统计理论
摘要
混合专家(Mixture of Experts, MoE)模型是统计和机器学习中广泛使用的集成学习方法,因其灵活性和计算效率而备受推崇,已成为分析来自不同领域的异构数据的前沿深度神经网络架构的关键组成部分。尽管取得了实际成功,但关于模型选择——尤其是关于混合组件或专家数量的最优选择——的理论理解仍有限,面临着显著挑战。这些挑战主要源于包含协变量的高斯门控函数和专家网络,引入了关于参数的偏微分方程所致的内在相互作用。在本文中,我们重新审视混合测度的树状图概念,提出一种新颖的扩展用于高斯门控高斯混合 MoE 模型,使其能够一致估计真实的混合组件数量,并在溢出场景下实现参数估计的点序列最优收敛速度。值得注意的是,这种方法规避了训练和比较不同组件数量的模型,因而在高维或深度神经网络设置下减轻了计算负担。合成数据的实验结果表明,所提方法在准确恢复专家数量方面有效,优于阿卡伊信息准则、贝叶斯信息准则和集成完成似然等常见准则,同时实现参数估计的最优收敛速度,准确逼近回归函数。
关键词
引用
@article{arxiv.2505.13052,
title = {Model Selection for Gaussian-gated Gaussian Mixture of Experts Using Dendrograms of Mixing Measures},
author = {Tuan Thai and TrungTin Nguyen and Dat Do and Nhat Ho and Christopher Drovandi},
journal= {arXiv preprint arXiv:2505.13052},
year = {2025}
}
备注
Correct typos and update the numerical experiments. Tuan Thai and TrungTin Nguyen are co-first authors