中文

僧伽罗语词性标注中的未登录词分析

计算与语言 2015-01-07 v1

摘要

词性(POS)是任何语言自然语言处理(NLP)任务中非常重要的主题,涉及语言结构、语言行为与语言动态的分析,这些知识可用于计算语言学分析与自动化应用。在此背景下,处理未登录词(未出现在词典中的词称为未登录词)也是一项重要任务,因为日益增多的 NLP 系统被用于越来越多的新应用。预测未登录词语法范畴的一种辅助手段是利用语言的句法知识。本研究利用开放类词与封闭类词的区别,结合语言的句法特征,在标注过程中预测未登录词的词汇范畴。我们进行了实验以考察该方法在无人工干预情况下利用句法知识解析未登录词的能力。实验表明,在解析包含僧伽罗语未登录词的句子时,将词类区分与句法规则结合使用可提升标注过程的性能。

关键词

引用

@article{arxiv.1501.01254,
  title  = {Unknown Words Analysis in POS tagging of Sinhala Language},
  author = {A. J. P. M. P. Jayaweera and N. G. J. Dias},
  journal= {arXiv preprint arXiv:1501.01254},
  year   = {2015}
}

备注

7 pages