依存句法分析中的组合泛化
计算与语言
2022-03-17 v2
摘要
组合性——将词等熟悉单元组合成新颖短语和句子的能力——近年来一直是人工智能领域密切关注的焦点。为测试语义分析中的组合泛化,Keysers 等人(2020)引入了组合 Freebase 查询(CFQ)数据集。该数据集在词等基元单元上最大化测试与训练分布的相似性,同时最大化复合散度:即短语等更大结构上的测试与训练分布的不相似性。然而,依存句法分析缺乏组合泛化基准。本工作中,我们为 CFQ 引入了一套金标准依存句法树,并借此分析最先进的依存句法分析器(Qi 等人,2020)在 CFQ 数据集上的行为。我们发现,复合散度的增大会降低依存句法分析性能,尽管不如语义分析性能下降得那么剧烈。此外,我们发现依存句法分析器的性能相对于复合散度并非均匀退化,且对于复合散度相同但不同划分的数据,分析器表现不同。我们探讨了导致依存句法分析性能非均匀退化的若干假设,并识别出若干驱动该分析器在最具挑战性划分上表现低下的句法结构。
引用
@article{arxiv.2110.06843,
title = {Compositional Generalization in Dependency Parsing},
author = {Emily Goodwin and Siva Reddy and Timothy J. O'Donnell and Dzmitry Bahdanau},
journal= {arXiv preprint arXiv:2110.06843},
year = {2022}
}
备注
12 pages 7 figures