论循环神经网络识别层次语言的实际能力
计算与语言
2020-11-10 v1 机器学习
摘要
尽管循环模型在 NLP 任务中表现有效,但研究发现它们在上下文无关语言(CFLs)上的性能相当弱。鉴于 CFLs 被认为捕捉了自然语言中的重要现象如层次结构,这种性能差异需要解释。我们研究了循环模型在 Dyck-n 语言上的性能,这是一类特别重要且被广泛研究的 CFLs。我们发现,若训练与测试字符串的长度来自同一范围,循环模型几乎可以完美泛化,但若测试字符串更长则表现不佳。同时,我们观察到循环模型在有限精度下若深度有界,则足以识别任意长度的 Dyck 词。因此,我们在有界深度 Dyck 语言生成的样本上评估模型,发现它们确实能够泛化到更长的长度。由于自然语言数据集具有有界深度的嵌套依赖,这可能有助于解释为何尽管先前工作表明在 Dyck 语言上泛化性能差,它们仍能很好地建模自然语言数据中的层次依赖。我们进行了探测研究以支持我们的结果,并与 Transformers 进行了比较。
引用
@article{arxiv.2011.03965,
title = {On the Practical Ability of Recurrent Neural Networks to Recognize Hierarchical Languages},
author = {Satwik Bhattamishra and Kabir Ahuja and Navin Goyal},
journal= {arXiv preprint arXiv:2011.03965},
year = {2020}
}
备注
COLING 2020