中文

在非拉丁文字上使用Punkt进行句子分割:基于库尔德语(索拉尼)文本的 experiments

计算与语言 2020-05-01 v2

摘要

分割是大多数自然语言处理任务的基础步骤。库尔德语是一种多方言、资源不足的语言,以不同文字书写。各种分割语料的缺乏是库尔德语处理的主要瓶颈之一。我们使用Punkt(一种无监督机器学习方法)对以波斯-阿拉伯文字书写的索拉尼方言库尔德语语料进行分割。根据文献,关于在非拉丁数据上使用Punkt的研究很少。在我们的实验中,我们取得了91.10%的F1分数和16.32%的错误率。高错误率主要归因于库尔德语中缩写的情况,部分由于序数词。数据已在https://github.com/KurdishBLARK/KTC-Segmented公开提供,供非商业使用,遵循CC BY-NC-SA 4.0许可。

关键词

引用

@article{arxiv.2004.14134,
  title  = {Using Punkt for Sentence Segmentation in non-Latin Scripts: Experiments on Kurdish (Sorani) Texts},
  author = {Roshna Omer Abdulrahman and Hossein Hassani},
  journal= {arXiv preprint arXiv:2004.14134},
  year   = {2020}
}

备注

Accepted for AfricaNLP Workshop at ICLR 2020