为乌兹别克语创建形态和句法标注语料库
计算与语言
2022-10-28 v1
摘要
如今,标注语料库的创建正成为自然语言处理(NLP)最重要的任务之一。对于资源匮乏的乌兹别克语,没有足够的标注语料库来构建机器学习模型。在本文中,我们试图通过开发一套新颖的词性(POS)和句法标注集来填补这一空白,用于创建乌兹别克语的句法和形态标注语料库。这项工作还包括对基于网络的标注应用程序的详细描述和展示。基于所开发的标注工具和软件,我们分享了标注语料库创建第一阶段的经验结果。
引用
@article{arxiv.2210.15234,
title = {Creating a morphological and syntactic tagged corpus for the Uzbek language},
author = {Maksud Sharipov and Jamolbek Mattiev and Jasur Sobirov and Rustam Baltayev},
journal= {arXiv preprint arXiv:2210.15234},
year = {2022}
}