基于统计方法开发马拉地语词性标注器
计算与语言
2013-10-10 v2
摘要
词性(POS)标注是将文本中的单词分配给特定词性的过程。词性标注的一个基本版本是将单词识别为名词、动词、形容词等。对于自然语言处理,词性标注是一项重要的工具。它是许多自然语言处理(NLP)应用中最简单、最稳定且基于统计的模型之一。词性标注是语言学和信息检索、机器翻译、文本转语音合成、信息抽取等文本分析的初始阶段。在词性标注中,我们为句子和文献中的每个单词分配一个词性标签。人们已提出多种方法来实现词性标注器。本文介绍了一种马拉地语词性标注器。马拉地语是一种形态丰富的语言,由马哈拉施特拉邦的本地人使用。开发该标注器的通用方法是基于统计的,使用了 Unigram、Bigram、Trigram 和隐马尔可夫模型(HMM)方法。本文通过合适的示例清晰地介绍了所有算法。此外,还引入了一套可用于标注马拉地语文本的标签集。本文展示了标注器的开发过程,并通过对比检查了标注器输出的准确率。三种马拉地语词性标注器(Unigram、Bigram、Trigram 和 HMM)的准确率分别为 77.38%、90.30%、91.46% 和 93.82%。
引用
@article{arxiv.1310.0575,
title = {Development of Marathi Part of Speech Tagger Using Statistical Approach},
author = {Jyoti Singh and Nisheeth Joshi and Iti Mathur},
journal= {arXiv preprint arXiv:1310.0575},
year = {2013}
}
备注
In Proceedings of 2013 International Conference on Advances in Computing, Communications and Informatics