LeaPformer:通过学习比例实现线性变换器在自回归和同步任务中的应用
计算与语言
2024-05-24 v1 机器学习
摘要
一种保持模型性能的有前景方法是采用基于位置的重新加权函数。然而,当前最先进的重新加权函数高度依赖目标序列长度,使得在自回归和同步任务中难以或无法应用,因为这些任务中目标序列长度甚至输入序列长度未知。为此,我们提出学习比例(Learned Proportions, LeaP)及LeaPformers。我们的贡献基于两个主要组成部分:首先,我们将基于显式位置表示和序列长度的依赖关系推广为基于序列比例的依赖关系;其次,我们用通过紧凑模块派生的动态比例取代静态位置表示,从而实现更灵活的注意力集中模式。我们在Long-Range Arena基准测试中对LeaPformer进行评估,测试了八个具有代表性的高效变换器,结果表明LeaPformer在质量-吞吐量权衡方面取得最佳表现。我们还将LeaPformer应用于Wikitext-103自回归语言建模和双语平行语料的同步语音到文本翻译,取得了具竞争力的结果。
引用
@article{arxiv.2405.13046,
title = {LeaPformer: Enabling Linear Transformers for Autoregressive and Simultaneous Tasks via Learned Proportions},
author = {Victor Agostinelli and Sanghyun Hong and Lizhong Chen},
journal= {arXiv preprint arXiv:2405.13046},
year = {2024}
}
备注
Submitted and accepted at ICML 2024