中文

自注意力中的深度与宽度权衡

机器学习 2021-01-19 v3 计算与语言 机器学习

摘要

自注意力架构正在迅速推进自然语言处理的前沿,却表现出一种令人惊讶的深度低效行为:先前工作表明,增加内部表示(网络宽度)与增加自注意力层数(网络深度)同样有效。我们理论上预测了自注意力中深度高效与深度低效之间依赖于宽度的转变。我们对深度为 6 到 48 的网络进行了系统的经验消融实验,清晰地揭示了理论预测的行为,并针对给定自注意力网络规模下的最优深度-宽度分配给出了明确的定量建议。迈向超万亿参数语言模型的竞赛,使得关于协同增加自注意力深度与宽度的知情指南成为关键要素。我们的指南阐明了规模直至 GPT3(我们预测其相对于自身规模而言过深)及更大规模的自注意力网络中的深度-宽度权衡,并标定了对于万亿参数网络最优的史无前例的 30K 宽度。

关键词

引用

@article{arxiv.2006.12467,
  title  = {The Depth-to-Width Interplay in Self-Attention},
  author = {Yoav Levine and Noam Wies and Or Sharir and Hofit Bata and Amnon Shashua},
  journal= {arXiv preprint arXiv:2006.12467},
  year   = {2021}
}

备注

NeurIPS 2020