Sumformer:面向高效Transformer的通用逼近
机器学习
2023-07-06 v1 计算与语言
机器学习
摘要
自然语言处理(NLP)随着Transformer的引入实现了令人瞩目的飞跃。ChatGPT是最著名的例子之一,甚至在研究界之外改变了人们对AI可能性的认知。然而,除了令人印象深刻的性能外,Transformer相对于序列长度的二次时间和空间复杂度给处理长序列带来了显著限制。尽管具有线性复杂度的Linformer和Performer等高效Transformer架构已成为有前景的解决方案,其理论理解仍然有限。本文中,我们提出Sumformer,一种能够通用逼近等变序列到序列函数的新颖简单架构。我们利用Sumformer给出了Linformer和Performer的首个通用逼近结果。此外,我们为Transformer推导了一个新的证明,表明仅一层注意力即足以实现通用逼近。
引用
@article{arxiv.2307.02301,
title = {Sumformer: Universal Approximation for Efficient Transformers},
author = {Silas Alberti and Niclas Dern and Laura Thesing and Gitta Kutyniok},
journal= {arXiv preprint arXiv:2307.02301},
year = {2023}
}