中文

西弗里斯兰语的词性标注、词形还原与依存句法分析

计算与语言 2021-07-29 v2 机器学习

摘要

我们提出了一个西弗里斯兰语的词形还原器/词性标注器/依存句法分析器,使用的语料库包含3,126个句子共44,714个词,这些句子根据通用依存关系(Universal Dependency)2版的标注指南进行了标注。词性标签的分配通过使用荷兰语词性标注器实现,该标注器应用于逐词直译文本,或应用于荷兰语平行文本的句子。当使用由弗里斯兰翻译程序Oersetter创建的逐词直译文本时,获得了最佳结果。形态学和句法标注同样基于荷兰语直译文本生成。我们比较了使用默认参数训练时该词形还原器/标注器/分析器的性能与使用训练LassySmall UD 2.5语料库所采用的参数值时的性能。发现“lemma(词元)”方面有显著改进。该弗里斯兰语词形还原器/词性标注器/依存句法分析器作为Web应用和Web服务发布。

关键词

引用

@article{arxiv.2107.07974,
  title  = {POS tagging, lemmatization and dependency parsing of West Frisian},
  author = {Wilbert Heeringa and Gosse Bouma and Martha Hofman and Eduard Drenth and Jan Wijffels and Hans Van de Velde},
  journal= {arXiv preprint arXiv:2107.07974},
  year   = {2021}
}

备注

6 pages, 2 figures, 6 tables