中文

自注意力网络如何识别 Dyck-n 语言?

计算与语言 2020-10-12 v1 形式语言与自动机理论 机器学习

摘要

我们聚焦于使用自注意力(SA)网络识别 Dyck-n(Dn\mathcal{D}_n)语言,这被视为此类网络的一项困难任务。我们比较了 SA 的两个变体:一个带起始符号(SA+^+),一个不带(SA^-)。我们的结果表明,SA+^+ 能够泛化到更长的序列和更深的依赖关系。对于 D2\mathcal{D}_2,我们发现 SA^- 在长序列上完全失效,而 SA+^+ 的准确率为 58.82%\%。我们发现 SA+\text{SA}{^+} 学习到的注意力图易于解释,并且与基于栈的语言识别器兼容。令人惊讶的是,SA 网络的性能与 LSTM 相当,这为 SA 无需递归即可学习层级结构的能力提供了证据。

关键词

引用

@article{arxiv.2010.04303,
  title  = {How Can Self-Attention Networks Recognize Dyck-n Languages?},
  author = {Javid Ebrahimi and Dhruv Gelda and Wei Zhang},
  journal= {arXiv preprint arXiv:2010.04303},
  year   = {2020}
}