神经成分句法分析器的跨领域泛化
计算与语言
2019-07-11 v1
摘要
神经分析器在成分句法分析的基准树库上取得了最先进的结果——但它们在多大程度上泛化到其他领域?我们给出了关于零样本设定下神经分析器泛化的三个结果:在一个语料库树上训练并在域外语料库上评估。首先,神经与非神经分析器对新领域的泛化能力相当。其次,将预训练编码器表示纳入神经分析器大幅提升了其在所有领域的性能,但并未给域外树库带来更大的相对提升。最后,尽管它们学习了丰富的输入表示,神经分析器仍受益于输出树的结构化输出预测,从而获得了更高的精确匹配准确率以及对更大文本跨度和域外语料库更强的泛化能力。我们分析了在英语和汉语语料库上的泛化,并在此过程中获得了 Brown、Genia 和 English Web 树库的最先进分析结果。
引用
@article{arxiv.1907.04347,
title = {Cross-Domain Generalization of Neural Constituency Parsers},
author = {Daniel Fried and Nikita Kitaev and Dan Klein},
journal= {arXiv preprint arXiv:1907.04347},
year = {2019}
}
备注
ACL 2019. DF and NK contributed equally