众多零计算专家的混合模型:高速率量化理论视角
机器学习
2025-10-06 v1
摘要
本文利用经典的高速率量化理论,为回归任务中的混合专家 (Mixture-of-Experts, MoE) 模型提供了新的见解。我们的 MoE 通过将输入空间划分为若干区域,每个区域都有一个单参数专家,作为推断时的常数预测器。受高速率量化理论假设的启发,我们假设专家数量足够大,以致其输入空间区域非常小。这使我们能够研究 MoE 模型类的近似误差:(i) 对于一维输入,我们形式化了测试误差及其最小化划分和专家;(ii) 对于多维输入,我们形式化了测试误差的上界并研究其最小化。此外,我们考虑给定输入空间划分,从训练数据集中学习专家参数,并对其统计学习特性进行分析。这导致我们在理论和实证上表明,MoE 学习中近似误差与估计误差之间的权衡如何取决于专家数量。
引用
@article{arxiv.2510.03151,
title = {Mixture of Many Zero-Compute Experts: A High-Rate Quantization Theory Perspective},
author = {Yehuda Dar},
journal= {arXiv preprint arXiv:2510.03151},
year = {2025}
}