在 54 种语言的词性标注、词形还原与依存解析上评估上下文嵌入
计算与语言
2019-08-21 v1
摘要
我们对三种近期提出的上下文嵌入方法在通用依存 2.3(Universal Dependencies 2.3)的 54 种语言 89 个语料库上的三项任务——词性标注、词形还原和依存解析——进行了广泛评估。将 BERT、Flair 和 ELMo 作为 UDPipe 2.0(CoNLL 2018 共享任务中性能最佳的系统之一,也是 EPE 2018 的总冠军)强基线中的预训练嵌入输入,我们给出了三种上下文词嵌入方法的一对一比较,以及与 word2vec 类预训练嵌入和端到端字符级词嵌入的比较。相较于 CoNLL 2018 共享任务中基于 UD 2.2 的结果,我们在三项任务上均报告了最先进的(state-of-the-art)结果。
引用
@article{arxiv.1908.07448,
title = {Evaluating Contextualized Embeddings on 54 Languages in POS Tagging, Lemmatization and Dependency Parsing},
author = {Milan Straka and Jana Straková and Jan Hajič},
journal= {arXiv preprint arXiv:1908.07448},
year = {2019}
}