阿尔巴尼亚语的形态标注与词形还原:人工标注语料库与神经模型
计算与语言
2019-12-03 v1
摘要
在本文中,我们提出了首个公开可用的阿尔巴尼亚语词性标注与形态标注语料库,以及在其上训练的神经形态标注器和词形还原器。目前阿尔巴尼亚语缺乏可用的NLP资源,其复杂的语法和形态给资源开发带来挑战。我们基于Universal Dependencies标注模式构建了阿尔巴尼亚语词性语料库,包含约118,000个来自不同文本来源的自然文本词符,并额外加入仅用于训练的67,000个人工构造简单句词符。在此语料库上,我们随后使用Turku Neural Parser Pipeline训练并评估了分词、形态标注和词形还原模型。在留出评估集上,该模型在词性标注上达到92.74%准确率,形态标注上85.31%,词形还原上89.95%。人工标注语料库及训练好的模型均以开放许可发布。
引用
@article{arxiv.1912.00991,
title = {Morphological Tagging and Lemmatization of Albanian: A Manually Annotated Corpus and Neural Models},
author = {Nelda Kote and Marenglen Biba and Jenna Kanerva and Samuel Rönnqvist and Filip Ginter},
journal= {arXiv preprint arXiv:1912.00991},
year = {2019}
}