中文

十六个头真的比一个头更好吗?

计算与语言 2019-11-05 v3

摘要

注意力是一种强大且普遍存在的机制,它通过在预测时取加权平均值,使神经模型聚焦于特定的显著信息片段。特别地,多头注意力是许多近期最先进 NLP 模型(如基于 Transformer 的机器翻译模型和 BERT)背后的驱动力。这些模型并行地应用多个注意力机制,每个注意力“头”可能聚焦于输入的不同部分,从而能够表达超越简单加权平均值之外的复杂函数。在本文中我们做出了一个令人惊讶的观察:即便模型是使用多个头训练得到的,在实践中,测试时移除很大比例的注意力头而不会显著影响性能。事实上,某些层甚至可被缩减为单个头。我们进一步考察了用于剪枝模型的贪心算法,以及由此可获得的潜在速度、内存效率和精度提升。最后,我们分析了哪些模型部分更依赖于拥有多个头的结果,并提供了初步证据,表明训练动态在多头注意力所带来的增益中起着作用。

关键词

引用

@article{arxiv.1905.10650,
  title  = {Are Sixteen Heads Really Better than One?},
  author = {Paul Michel and Omer Levy and Graham Neubig},
  journal= {arXiv preprint arXiv:1905.10650},
  year   = {2019}
}

备注

NeurIPS 2019