在更难的主谓一致实例上训练的RNN是否仍能在更简单实例上表现良好
计算与语言
2021-04-12 v2 机器学习
摘要
先前的研究表明,在自然语言语料上训练的RNN能较好地捕捉简单句子的数一致,但当句子包含一致吸引子(即动词与主主语之间插入的、语法数与后者相反的名词)时表现较差。这表明这些模型可能并未学习到一致的实际句法,而是推断出较浅的启发式规则,如“与最近的名词保持一致”。在本工作中,我们研究具有不同归纳偏置的RNN模型,这些模型在选择性选取的“难”一致实例(即至少包含一个一致吸引子的句子)上训练。对于这些句子,动词的数无法用简单的线性启发式预测,因此可能有助于为模型提供层级句法的额外线索。如果RNN在此类难实例上训练时能学习到潜在的一致规则,那么它们应当能很好地泛化到其他句子,包括更简单的句子。然而,我们观察到若干种RNN(包括具有软结构归纳偏置的ONLSTM)在仅以含吸引子的句子训练时,出人意料地无法在没有吸引子的句子上表现良好。我们沿数一致准确率、表征相似性和不同句法结构上的表现等维度,分析了这些选择性训练的RNN与基线(在自然的一致吸引子分布上训练)的比较。我们的发现表明,在我们难一致实例上训练的RNN仍未能捕捉一致的底层句法,而是倾向于过拟合训练分布,从而导致其在“简单”的分布外实例上表现糟糕。因此,尽管RNN是能捕捉非平凡依赖模式的强大模型,引导其在句法而非表层层面做到这一点仍是一项挑战。
引用
@article{arxiv.2010.04976,
title = {Can RNNs trained on harder subject-verb agreement instances still perform well on easier ones?},
author = {Hritik Bansal and Gantavya Bhatt and Sumeet Agarwal},
journal= {arXiv preprint arXiv:2010.04976},
year = {2021}
}
备注
15 pages, 3 figures, 13 Tables (including Appendix); Non Archival Extended Abstract Accepted in SciL 2021 - https://scholarworks.umass.edu/scil/vol4/iss1/38/