中文

UDPipe 在 EvaLatin 2020 中的表现:上下文嵌入与树库嵌入

计算与语言 2020-06-09 v1

摘要

我们介绍了在 EvaLatin 共享任务中的工作,这是首个致力于评估拉丁语 NLP 工具的评价活动。我们提交了一个基于 UDPipe 2.0 的系统,该系统是 CoNLL 2018 共享任务、2018 年外部解析器评价共享任务以及 SIGMORPHON 2019 共享任务的优胜者之一。我们的系统在开放模态下的词形还原和词性标注中均以大幅优势位居第一,该模态允许使用额外的有监督数据,在此情况下我们利用了所有 Universal Dependency 拉丁语树库。在仅允许使用 EvaLatin 训练数据的封闭模态中,我们的系统在词形还原和经典词性标注子任务中取得了最佳性能,而在跨体裁和跨时代设定中排名第二。在消融实验中,我们还评估了 BERT 和 XLM-RoBERTa 上下文嵌入,以及不同变体拉丁语树库的树库编码的影响。

关键词

引用

@article{arxiv.2006.03687,
  title  = {UDPipe at EvaLatin 2020: Contextualized Embeddings and Treebank Embeddings},
  author = {Milan Straka and Jana Straková},
  journal= {arXiv preprint arXiv:2006.03687},
  year   = {2020}
}

备注

Accepted at EvaLatin 2020, LREC (Proceedings of Language Resources and Evaluation, Marseille, France)