中文

众多零计算专家的混合模型:高速率量化理论视角

机器学习 2025-10-06 v1

摘要

本文利用经典的高速率量化理论,为回归任务中的混合专家 (Mixture-of-Experts, MoE) 模型提供了新的见解。我们的 MoE 通过将输入空间划分为若干区域,每个区域都有一个单参数专家,作为推断时的常数预测器。受高速率量化理论假设的启发,我们假设专家数量足够大,以致其输入空间区域非常小。这使我们能够研究 MoE 模型类的近似误差:(i) 对于一维输入,我们形式化了测试误差及其最小化划分和专家;(ii) 对于多维输入,我们形式化了测试误差的上界并研究其最小化。此外,我们考虑给定输入空间划分,从训练数据集中学习专家参数,并对其统计学习特性进行分析。这导致我们在理论和实证上表明,MoE 学习中近似误差与估计误差之间的权衡如何取决于专家数量。

关键词

引用

@article{arxiv.2510.03151,
  title  = {Mixture of Many Zero-Compute Experts: A High-Rate Quantization Theory Perspective},
  author = {Yehuda Dar},
  journal= {arXiv preprint arXiv:2510.03151},
  year   = {2025}
}