自注意力网络如何识别 Dyck-n 语言?
计算与语言
2020-10-12 v1 形式语言与自动机理论
机器学习
摘要
我们聚焦于使用自注意力(SA)网络识别 Dyck-n()语言,这被视为此类网络的一项困难任务。我们比较了 SA 的两个变体:一个带起始符号(SA),一个不带(SA)。我们的结果表明,SA 能够泛化到更长的序列和更深的依赖关系。对于 ,我们发现 SA 在长序列上完全失效,而 SA 的准确率为 58.82。我们发现 学习到的注意力图易于解释,并且与基于栈的语言识别器兼容。令人惊讶的是,SA 网络的性能与 LSTM 相当,这为 SA 无需递归即可学习层级结构的能力提供了证据。
引用
@article{arxiv.2010.04303,
title = {How Can Self-Attention Networks Recognize Dyck-n Languages?},
author = {Javid Ebrahimi and Dhruv Gelda and Wei Zhang},
journal= {arXiv preprint arXiv:2010.04303},
year = {2020}
}