(P)ReLU MLP混合专家模型的逼近率与VC维界
机器学习
2024-05-28 v2 机器学习
数值分析
神经与进化计算
组合数学
数值分析
摘要
混合专家模型(MoEs)通过采用路由策略,即每个输入由单个“专家”深度学习模型处理,可以扩展到传统深度学习模型之外。这种策略允许我们在保持稀疏激活的同时增加定义MoE的参数数量,即MoE仅根据输入将总参数的一小部分加载到GPU显存中进行前向传播。在本文中,我们提供了具有(P)ReLU激活函数的专家MLP混合模型的逼近和学习理论分析。我们首先证明,对于每个误差水平和每个Lipschitz函数,可以构造一个MoMLP模型(由(P)ReLU MLP组成的混合专家模型),在上以精度一致逼近,同时仅需要在内存中加载个参数的网络。此外,我们表明MoMLP可以泛化,因为整个MoMLP模型具有有限的VC维,为,如果有个专家,且每个专家的宽度和深度分别为和。
引用
@article{arxiv.2402.03460,
title = {Approximation Rates and VC-Dimension Bounds for (P)ReLU MLP Mixture of Experts},
author = {Anastasis Kratsios and Haitz Sáez de Ocáriz Borde and Takashi Furuya and Marc T. Law},
journal= {arXiv preprint arXiv:2402.03460},
year = {2024}
}