中文

单头注意力 RNN:别用你的头思考

计算与语言 2019-11-28 v2 人工智能 神经与进化计算

摘要

语言建模领域的主流方法全都痴迷于我年轻时的电视节目——即 Transformer 和芝麻街。这个 Transformer,那个 Transformer,还有一堆 GPU-TPU-神经形态晶圆级硅在燃烧。我们选择老旧且经证实技术的懒人路径,并冠以一个受密码学启发的花哨缩写:单头注意力 RNN (SHA-RNN)。作者唯一的目标是表明,如果我们当初痴迷于一个稍有不同的缩写和稍有不同的结果,整个领域或许会朝不同方向演进。我们取一个仅基于无聊 LSTM 的先前强语言模型,让其在 enwik8 上达到离最先进字节级语言模型结果仅一步之遥(近乎一步之遥)的性能。本工作未经过任何 intensive 超参数优化,且完全运行在一台商用台式机上,该机器在旧金山夏日让作者的小 studio 公寓过于温暖。最终结果在单块 GPU 上正负 24 小时内即可达成,因为作者没耐心。该注意力机制也可轻易扩展到大型上下文且计算开销极小。去你的芝麻街。

关键词

引用

@article{arxiv.1911.11423,
  title  = {Single Headed Attention RNN: Stop Thinking With Your Head},
  author = {Stephen Merity},
  journal= {arXiv preprint arXiv:1911.11423},
  year   = {2019}
}

备注

Addition of citations and contextual results (no attention head, single attention head, attention per layer), removal of wordpiece WikiText-103 numbers due to normalization issues, fix of SHA attention figure Q arrow, other minor fixes