Transformer中的自适应注意力跨度
机器学习
2019-08-09 v2 机器学习
摘要
我们提出了一种新颖的自注意力机制,能够学习其最优注意力跨度。这使得我们能够在显著扩展Transformer所使用的最大上下文大小的同时,保持其内存占用与计算时间的可控。我们在字符级语言建模任务上展示了方法的有效性,通过使用最大8k字符的上下文,在text8和enwiki8上取得了最先进的性能。
关键词
引用
@article{arxiv.1905.07799,
title = {Adaptive Attention Span in Transformers},
author = {Sainbayar Sukhbaatar and Edouard Grave and Piotr Bojanowski and Armand Joulin},
journal= {arXiv preprint arXiv:1905.07799},
year = {2019}
}
备注
Accepted to ACL 2019