中文

Transformer中的自适应注意力跨度

机器学习 2019-08-09 v2 机器学习

摘要

我们提出了一种新颖的自注意力机制,能够学习其最优注意力跨度。这使得我们能够在显著扩展Transformer所使用的最大上下文大小的同时,保持其内存占用与计算时间的可控。我们在字符级语言建模任务上展示了方法的有效性,通过使用最大8k字符的上下文,在text8和enwiki8上取得了最先进的性能。

关键词

引用

@article{arxiv.1905.07799,
  title  = {Adaptive Attention Span in Transformers},
  author = {Sainbayar Sukhbaatar and Edouard Grave and Piotr Bojanowski and Armand Joulin},
  journal= {arXiv preprint arXiv:1905.07799},
  year   = {2019}
}

备注

Accepted to ACL 2019