中文

克服自注意力的一个理论局限

机器学习 2022-02-25 v1 计算与语言

摘要

尽管 Transformer 在许多任务上极为有效,但仍有一些看似简单的正则语言让它们难以处理。Hahn 指出,对于接受与否取决于单个输入符号的语言,随着输入字符串越来越长,Transformer 的分类决策会变得越来越不自信(即交叉熵趋近于每字符串 1 bit)。我们使用两种语言来考察这一局限:PARITY,即含奇数个 1 的位串语言;以及 FIRST,即以 1 开头的位串语言。我们展示了三种克服 Hahn 引理所暗示的局限的方法。首先,我们构造了一个能以完美准确率识别 PARITY 的 Transformer,对 FIRST 同理,从而解决了一个开放问题。其次,我们使用层归一化将两种模型的交叉熵任意逼近零。第三,当 Transformer 需要聚焦于单个位置(如 FIRST)时,我们发现它们可能无法泛化到更长的字符串;我们针对该问题给出了一个简单的补救方法,同时也改善了机器翻译中的长度泛化。

关键词

引用

@article{arxiv.2202.12172,
  title  = {Overcoming a Theoretical Limitation of Self-Attention},
  author = {David Chiang and Peter Cholak},
  journal= {arXiv preprint arXiv:2202.12172},
  year   = {2022}
}

备注

Accepted at ACL 2022