克服自注意力的一个理论局限
机器学习
2022-02-25 v1 计算与语言
摘要
尽管 Transformer 在许多任务上极为有效,但仍有一些看似简单的正则语言让它们难以处理。Hahn 指出,对于接受与否取决于单个输入符号的语言,随着输入字符串越来越长,Transformer 的分类决策会变得越来越不自信(即交叉熵趋近于每字符串 1 bit)。我们使用两种语言来考察这一局限:PARITY,即含奇数个 1 的位串语言;以及 FIRST,即以 1 开头的位串语言。我们展示了三种克服 Hahn 引理所暗示的局限的方法。首先,我们构造了一个能以完美准确率识别 PARITY 的 Transformer,对 FIRST 同理,从而解决了一个开放问题。其次,我们使用层归一化将两种模型的交叉熵任意逼近零。第三,当 Transformer 需要聚焦于单个位置(如 FIRST)时,我们发现它们可能无法泛化到更长的字符串;我们针对该问题给出了一个简单的补救方法,同时也改善了机器翻译中的长度泛化。
引用
@article{arxiv.2202.12172,
title = {Overcoming a Theoretical Limitation of Self-Attention},
author = {David Chiang and Peter Cholak},
journal= {arXiv preprint arXiv:2202.12172},
year = {2022}
}
备注
Accepted at ACL 2022