中文

$O(n)$连接已足够具表达力:稀疏Transformer的通用逼近性

机器学习 2020-12-22 v2 机器学习

摘要

近来,Transformer网络在许多NLP任务中重新定义了最优水平。然而,这些模型在每层计算两两注意力时,对输入序列长度nn具有二次计算代价。这促使近期研究稀疏Transformer以稀疏化注意力层中的连接。尽管在长序列上经验上颇有前景,基本问题仍待解答:稀疏Transformer能否像其稠密对应物一样逼近任意序列到序列函数?稀疏模式与稀疏程度如何影响其性能?本文中,我们解决这些问题并提供一个涵盖现有稀疏注意力模型的统一框架。我们提出充分条件,并在此条件下证明稀疏注意力模型可通用逼近任意序列到序列函数。令人惊讶的是,我们的结果表明每层仅具O(n)O(n)连接的稀疏Transformer可逼近与具n2n^2连接的稠密模型相同的函数类。最后,我们给出在标准NLP任务上比较不同稀疏模式/程度的实验。

关键词

引用

@article{arxiv.2006.04862,
  title  = {$O(n)$ Connections are Expressive Enough: Universal Approximability of Sparse Transformers},
  author = {Chulhee Yun and Yin-Wen Chang and Srinadh Bhojanapalli and Ankit Singh Rawat and Sashank J. Reddi and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2006.04862},
  year   = {2020}
}

备注

31 pages, NeurIPS 2020 Camera-ready