中文

并非所有参数生而平等:注意力基本就是你所需的一切

计算与语言 2021-09-22 v2

摘要

Transformer 在最优机器翻译中被广泛使用,但其成功的关键仍未知。为深入了解这一点,我们考虑三类参数:嵌入、注意力和前馈神经网络(FFN)层。我们通过消融研究考察各自相对重要性,即将它们随机初始化并冻结,使其权重在训练过程中不改变。借此,我们表明注意力和 FFN 同等重要,并在模型中履行相同功能。我们表明,关于一个组件是被冻结还是允许训练的决策,对其最终模型性能的重要性至少等同于其参数数量。同时,参数数量本身并不能指示一个组件的重要性。最后,虽然嵌入层对机器翻译任务最不重要,但它是语言建模任务中最重要的组件。

关键词

引用

@article{arxiv.2010.11859,
  title  = {Not all parameters are born equal: Attention is mostly what you need},
  author = {Nikolay Bogoychev},
  journal= {arXiv preprint arXiv:2010.11859},
  year   = {2021}
}

备注

Accepted at BlackboxNLP 2021