中文

$h-1$ 个头的混合优于 $h$ 个头

计算与语言 2020-05-15 v1

摘要

多头注意力神经网络架构已在多种自然语言处理任务上取得最先进的结果。有证据表明它们存在过参数化现象;注意力头可以在不显著损失性能的情况下被剪枝。在本工作中,我们转而“重新分配”它们——模型学习在不同的输入上激活不同的头。通过将多头注意力与专家混合联系起来,我们提出了混合注意力专家模型(MAE)。MAE 使用块坐标下降算法训练,该算法交替更新(1)专家的职责与(2)其参数。在机器翻译和语言建模上的实验表明,MAE 在两项任务上均优于强基线。特别是在 WMT14 英德翻译数据集上,MAE 以可比数量的参数比“transformer-base”提升了 0.8 BLEU。我们的分析显示,我们的模型学会将不同的专家专门化于不同的输入。

关键词

引用

@article{arxiv.2005.06537,
  title  = {A Mixture of $h-1$ Heads is Better than $h$ Heads},
  author = {Hao Peng and Roy Schwartz and Dianqi Li and Noah A. Smith},
  journal= {arXiv preprint arXiv:2005.06537},
  year   = {2020}
}

备注

ACL2020