中文

有限速率门控下的混合专家:通信-泛化权衡

机器学习 2026-03-27 v2 信息论 机器学习 math.IT

摘要

混合专家(MoE)架构将预测任务分解为由门控机制选择的专家子网络。该 letter 采用通信理论视角观察 MoE 门控,将门控建模为受限信息速率的随机信道。在信息论学习框架内,我们专化相互信息泛化界,发展有限速率门控的率失真特征 D(Rg)D(R_g),其中 Rg:=I(X;T)R_g:=I(X; T),从而在(标准经验率失真最优条件下)得到 E[R(W)]D(Rg)+δm+(2/m)I(S;W)\mathbb{E}[R(W)] \le D(R_g)+\delta_m+\sqrt{(2/m)\, I(S; W)}。该分析揭示了面向通信受限 MoE 系统的容量意识限制,数值仿真在合成多专家模型上实证确认了门控速率、表达性和泛化之间的预测权衡。

关键词

引用

@article{arxiv.2602.15091,
  title  = {Mixture-of-Experts under Finite-Rate Gating: Communication--Generalization Trade-offs},
  author = {Ali Khalesi and Mohammad Reza Deylam Salehi},
  journal= {arXiv preprint arXiv:2602.15091},
  year   = {2026}
}