神经序列模型中自注意力的理论局限
计算与语言
2021-06-28 v2 形式语言与自动机理论
机器学习
摘要
Transformer正成为NLP的新主力,在各任务上展现巨大成功。与LSTM不同,Transformer完全通过自注意力处理输入序列。已有工作表明,自注意力处理层次结构的计算能力有限。本文从数学上研究自注意力建模形式语言的计算能力。在软注意力和硬注意力下,我们均展示了自注意力计算能力的强理论局限,发现除非层数或头数随输入长度增加,否则它无法建模周期性有限状态语言,也无法建模层次结构。鉴于自注意力的实际成功以及层次结构在语言学中的突出地位,这些局限看似令人惊讶,表明自然语言可用远弱于理论语言学通常假设的形式语言的模型很好地近似。
引用
@article{arxiv.1906.06755,
title = {Theoretical Limitations of Self-Attention in Neural Sequence Models},
author = {Michael Hahn},
journal= {arXiv preprint arXiv:1906.06755},
year = {2021}
}
备注
Accepted by: Transactions of the Association for Computational Linguistics