中文

Transformer 是否为序列到序列函数的通用逼近器?

机器学习 2020-02-26 v2 机器学习

摘要

尽管 Transformer 模型已被广泛采用于 NLP 任务,这些模型的表达能力却未被很好理解。本文确立 Transformer 模型是具紧支撑的连续置换等变序列到序列函数的通用逼近器,考虑到这些模型中大量的参数共享,这是相当令人惊讶的。此外,利用位置编码,我们规避了置换等变性的限制,并证明 Transformer 模型能在紧域上通用逼近任意连续序列到序列函数。有趣的是,我们的证明技术清晰凸显了 Transformer 中自注意力层与前馈层的不同作用。特别地,我们证明固定宽度的自注意力层可计算输入序列的上下文映射,在 Transformer 的通用逼近性质中扮演关键角色。基于我们分析所得的这一洞见,我们考虑其他更简单的自注意力层替代方案并做了经验评估。

关键词

引用

@article{arxiv.1912.10077,
  title  = {Are Transformers universal approximators of sequence-to-sequence functions?},
  author = {Chulhee Yun and Srinadh Bhojanapalli and Ankit Singh Rawat and Sashank J. Reddi and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:1912.10077},
  year   = {2020}
}

备注

23 pages, ICLR 2020 camera-ready version