中文

SHAQ:具有拟递归特性的单头注意力模型

计算与语言 2021-08-23 v1 人工智能

摘要

自然语言处理研究近来由大规模 transformer 模型主导。尽管它们在许多重要语言任务上达到了 SOTA,但 transformer 通常需要昂贵的算力资源,以及长达数天至数周的训练时间。这对于大型科技公司和顶尖研究机构的学者可行,但对于初创公司创始人、学生和独立研究者则不然。Stephen Merity 的 SHA-RNN 是一种紧凑的混合注意力-RNN 模型,专为消费级建模设计,因其所需参数量显著更少、训练时间更短即可取得接近 SOTA 的结果。我们在此通过对该架构若干单元在训练时间与整体质量方面的探索性模型分析,对 Merity 的模型进行了分析。最终,我们将这些发现整合为一种新架构,称为 SHAQ:单头注意力拟递归神经网络(Single Headed Attention Quasi-recurrent Neural Network)。借助新架构,我们在取得与 SHA-RNN 相近准确率的同时,实现了 4 倍的训练加速。

关键词

引用

@article{arxiv.2108.08207,
  title  = {SHAQ: Single Headed Attention with Quasi-Recurrence},
  author = {Nashwin Bharwani and Warren Kushner and Sangeet Dandona and Ben Schreiber},
  journal= {arXiv preprint arXiv:2108.08207},
  year   = {2021}
}

备注

8 pages, 11 figures