$O(n)$连接已足够具表达力:稀疏Transformer的通用逼近性
机器学习
2020-12-22 v2 机器学习
摘要
近来,Transformer网络在许多NLP任务中重新定义了最优水平。然而,这些模型在每层计算两两注意力时,对输入序列长度具有二次计算代价。这促使近期研究稀疏Transformer以稀疏化注意力层中的连接。尽管在长序列上经验上颇有前景,基本问题仍待解答:稀疏Transformer能否像其稠密对应物一样逼近任意序列到序列函数?稀疏模式与稀疏程度如何影响其性能?本文中,我们解决这些问题并提供一个涵盖现有稀疏注意力模型的统一框架。我们提出充分条件,并在此条件下证明稀疏注意力模型可通用逼近任意序列到序列函数。令人惊讶的是,我们的结果表明每层仅具连接的稀疏Transformer可逼近与具连接的稠密模型相同的函数类。最后,我们给出在标准NLP任务上比较不同稀疏模式/程度的实验。
引用
@article{arxiv.2006.04862,
title = {$O(n)$ Connections are Expressive Enough: Universal Approximability of Sparse Transformers},
author = {Chulhee Yun and Yin-Wen Chang and Srinadh Bhojanapalli and Ankit Singh Rawat and Sashank J. Reddi and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2006.04862},
year = {2020}
}
备注
31 pages, NeurIPS 2020 Camera-ready