中文

基于均衡分配的无偏梯度估计用于混合专家模型

机器学习 2021-12-09 v2 机器学习

摘要

在现代硬件上高效训练大规模混合专家(mixture of experts)模型需要将一个批次中的数据点分配给不同专家,各专家容量有限。近期提出的分配过程缺乏概率解释,并使用有偏估计量进行训练。作为替代,我们基于有原则的随机分配过程提出两个无偏估计量:其一跳过超出专家容量的数据点,其二利用Gumbel-Matching分布[29]的扩展对完美均衡分配进行采样。两个估计量均为无偏,因其对所用采样过程进行了修正。在玩具实验中,我们发现“跳过”估计量比均衡采样估计量更有效,且二者在解决该任务时均比有偏替代方案更鲁棒。

关键词

引用

@article{arxiv.2109.11817,
  title  = {Unbiased Gradient Estimation with Balanced Assignments for Mixtures of Experts},
  author = {Wouter Kool and Chris J. Maddison and Andriy Mnih},
  journal= {arXiv preprint arXiv:2109.11817},
  year   = {2021}
}

备注

I (Still) Can't Believe It's Not Better Workshop at NeurIPS 2021