中文

凸化Transformer:改进优化与理解Transformer网络

机器学习 2022-11-23 v1 人工智能 计算与语言 机器学习

摘要

理解Transformer网络成功背后的基本机制仍是深度学习文献中的一个开放问题。尽管其卓越性能多被归因于自注意力机制,文献仍缺乏对这些网络的扎实分析以及对它们所学函数的解释。为此,我们研究注意力/Transformer网络的训练问题,并引入一种新颖的凸分析方法来增进对这些网络的理解与优化。具体而言,我们首先提出自注意力机制的凸替代,并用我们的替代凸注意力重新表述Transformer网络的正则化训练问题。随后,我们将该重新表述转化为一个可解释且更易优化的凸优化问题。此外,作为我们凸分析的副产物,我们揭示了一种隐式正则化机制,其促进跨词元(token)的稀疏性。因此,我们不仅改进了注意力/Transformer网络的优化,还对其所学函数提供了坚实的理论理解。我们也通过若干数值实验证明了我们理论的有效性。

关键词

引用

@article{arxiv.2211.11052,
  title  = {Convexifying Transformers: Improving optimization and understanding of transformer networks},
  author = {Tolga Ergen and Behnam Neyshabur and Harsh Mehta},
  journal= {arXiv preprint arXiv:2211.11052},
  year   = {2022}
}