有限速率门控下的混合专家:通信-泛化权衡
机器学习
2026-03-27 v2 信息论
机器学习
math.IT
摘要
混合专家(MoE)架构将预测任务分解为由门控机制选择的专家子网络。该 letter 采用通信理论视角观察 MoE 门控,将门控建模为受限信息速率的随机信道。在信息论学习框架内,我们专化相互信息泛化界,发展有限速率门控的率失真特征 ,其中 ,从而在(标准经验率失真最优条件下)得到 。该分析揭示了面向通信受限 MoE 系统的容量意识限制,数值仿真在合成多专家模型上实证确认了门控速率、表达性和泛化之间的预测权衡。
引用
@article{arxiv.2602.15091,
title = {Mixture-of-Experts under Finite-Rate Gating: Communication--Generalization Trade-offs},
author = {Ali Khalesi and Mohammad Reza Deylam Salehi},
journal= {arXiv preprint arXiv:2602.15091},
year = {2026}
}