温度对Softmax高斯混合专家模型是否具有样本效率?
机器学习
2024-06-25 v2 机器学习
摘要
稠密到稀疏的门控混合专家模型(MoE)最近已成为众所周知的稀疏MoE的有效替代方案。与后者模型中固定激活专家数量(这可能限制对潜在专家的探索)不同,前者模型利用温度来控制softmax权重分布和训练期间MoE的稀疏性,以稳定专家专业化。然而,尽管先前已有尝试从理论上理解稀疏MoE,但对稠密到稀疏门控MoE的全面分析仍然缺失。因此,本文旨在探索稠密到稀疏门控对高斯MoE下最大似然估计的影响。我们证明,由于温度与其他模型参数之间通过某些偏微分方程的相互作用,参数估计的收敛速度比任何多项式速率都慢,并且可能慢至 ,其中 表示样本大小。为了解决这个问题,我们提出使用一种新颖的激活稠密到稀疏门控,它将线性层的输出传递给一个激活函数,然后再传递给softmax函数。通过对激活函数及其导数施加线性无关条件,我们证明参数估计速率显著提高到多项式速率。最后,我们进行了模拟研究,以实证验证我们的理论结果。
引用
@article{arxiv.2401.13875,
title = {Is Temperature Sample Efficient for Softmax Gaussian Mixture of Experts?},
author = {Huy Nguyen and Pedram Akbarian and Nhat Ho},
journal= {arXiv preprint arXiv:2401.13875},
year = {2024}
}
备注
Accepted to ICML 2024, 47 pages, 2 figures, 2 tables