按需注意力:PAR Transformer
机器学习
2021-05-18 v3 计算与语言
摘要
基于 Transformer 的模型由交错的前馈块(捕获内容含义)和相对更昂贵的自注意力块(捕获上下文含义)组成。在本文中,我们探索了这些块的权衡与排序,以改进当前的 Transformer 架构,并提出了 PAR Transformer。它通过用前馈块替换约 63% 的自注意力块,实现了比 Transformer-XL 低 35% 的计算时间,并在 WikiText-103 语言建模基准上保持了困惑度。我们进一步在 text8 和 enwiki8 数据集以及 BERT 模型上验证了我们的结果。
引用
@article{arxiv.2009.04534,
title = {Pay Attention when Required},
author = {Swetha Mandava and Szymon Migacz and Alex Fit Florea},
journal= {arXiv preprint arXiv:2009.04534},
year = {2021}
}
备注
9 pages, 5 figures, 7 tables