面向依存解析器跨语言迁移的实例级解析器选择
计算与语言
2020-04-17 v1
摘要
当前的跨语言解析器迁移方法侧重于全局地为低资源目标语言预测最佳解析器,即“在树库级别”。在这项工作中,我们提出并论证了一种新颖的跨语言迁移范式:实例级解析器选择(ILPS),并展示了一项以去词汇化解析器迁移框架下实例级选择为重点的概念验证研究。我们从一个经验观察出发:不同的源解析器是目标语言中不同通用词性(Universal POS)序列的最佳选择。我们随后提出在实例级别预测最佳解析器。为此,我们训练了一个基于 Transformer 架构的监督回归模型,以预测单个 POS 序列的解析器准确率。我们将 ILPS 与两个强大的单最佳解析器选择基线(SBPS)进行比较:(1)一种比较源语言与目标语言之间 POS n-gram 分布的模型(KL);(2)一种基于手动创建的语言向量(编码语言句法属性)之间相似性来选择源的模型(L2V)。我们广泛评估的结果(耦合 42 个源解析器与 20 种多样的低资源测试语言)显示,ILPS 分别在 13/20 和 14/20 的测试语言上优于 KL 和 L2V。此外,我们表明,通过使用我们实例级模型预测的聚合,在“树库级别”(SBPS)预测最佳解析器,我们在 17/20 和 16/20 的测试语言上优于相同基线。
引用
@article{arxiv.2004.07642,
title = {Towards Instance-Level Parser Selection for Cross-Lingual Transfer of Dependency Parsers},
author = {Robert Litschko and Ivan Vulić and Željko Agić and Goran Glavaš},
journal= {arXiv preprint arXiv:2004.07642},
year = {2020}
}