中文

基于条件随机场(CRFs)的乌尔都语分词

计算与语言 2018-06-15 v1

摘要

最先进的自然语言处理算法严重依赖高效的分词。乌尔都语是分词任务复杂的一类语言,因为它存在空格省略和空格插入问题。这部分归因于阿拉伯文字,尽管本质上是连写的,但无论词边界如何,都包含具有固有连接和非连接属性的字符。本文提出一种乌尔都语分词系统,使用具有正字法、语言学和形态学特征的条件随机场序列建模器。我们提出的模型自动学习预测空白作为词边界以及零宽非连接符(ZWNJ)作为子词边界。使用人工标注语料库,我们的模型在词边界识别和子词边界识别任务上分别达到0.97和0.85的F1分数。我们已公开代码和语料库以使结果可复现。

关键词

引用

@article{arxiv.1806.05432,
  title  = {Urdu Word Segmentation using Conditional Random Fields (CRFs)},
  author = {Haris Bin Zia and Agha Ali Raza and Awais Athar},
  journal= {arXiv preprint arXiv:1806.05432},
  year   = {2018}
}

备注

8 pages, COLING 2018