并非所有参数生而平等:注意力基本就是你所需的一切
计算与语言
2021-09-22 v2
摘要
Transformer 在最优机器翻译中被广泛使用,但其成功的关键仍未知。为深入了解这一点,我们考虑三类参数:嵌入、注意力和前馈神经网络(FFN)层。我们通过消融研究考察各自相对重要性,即将它们随机初始化并冻结,使其权重在训练过程中不改变。借此,我们表明注意力和 FFN 同等重要,并在模型中履行相同功能。我们表明,关于一个组件是被冻结还是允许训练的决策,对其最终模型性能的重要性至少等同于其参数数量。同时,参数数量本身并不能指示一个组件的重要性。最后,虽然嵌入层对机器翻译任务最不重要,但它是语言建模任务中最重要的组件。
引用
@article{arxiv.2010.11859,
title = {Not all parameters are born equal: Attention is mostly what you need},
author = {Nikolay Bogoychev},
journal= {arXiv preprint arXiv:2010.11859},
year = {2021}
}
备注
Accepted at BlackboxNLP 2021