中文

75 种语言,1 个模型:普适解析通用依存关系

计算与语言 2019-08-27 v3 机器学习

摘要

我们提出 UDify,一个多语言多任务模型,能够同时为涵盖 75 种语言的全部 124 个通用依存(Universal Dependencies)树库准确预测通用词性、形态学特征、词元与依存树。通过利用在 104 种语言上预训练的多语言 BERT 自注意力模型,我们发现将其在所有拼接的数据集上微调,并为每个 UD 任务使用简单 softmax 分类器,可在无需任何循环或语言特定组件的情况下,取得最先进的 UPOS、UFeats、Lemmas、UAS 与 LAS 分数。我们针对多语言学习评估 UDify,表明低资源语言从跨语言标注中获益最大。我们还针对零样本学习进行评估,结果表明多语言训练即便对 UDify 与 BERT 均未曾训练过的语言也能提供稳健的 UD 预测。UDify 的代码见 https://github.com/hyperparticle/udify。

关键词

引用

@article{arxiv.1904.02099,
  title  = {75 Languages, 1 Model: Parsing Universal Dependencies Universally},
  author = {Dan Kondratyuk and Milan Straka},
  journal= {arXiv preprint arXiv:1904.02099},
  year   = {2019}
}

备注

Accepted for publication at EMNLP 2019. 17 pages, 6 figures