基于规则的乌尔都语词干提取器
计算与语言
2013-10-03 v1
摘要
乌尔都语是阿拉伯语、印地语、英语、土耳其语、梵语等多种语言的混合体,具有复杂且丰富的形态。这就是乌尔都语语言处理方面研究工作不多的原因。词干提取用于将单词转换为其相应的词根形式。在词干提取中,我们将后缀和前缀从单词中分离出来。它在搜索引擎、自然语言处理和文字处理、拼写检查器、单词解析、词频和计数研究中非常有用。本文提出了一种基于规则的乌尔都语词干提取器。我们在此讨论的词干提取器用于信息检索。我们还通过与人类专家验证来评估了我们的结果。
引用
@article{arxiv.1310.0581,
title = {Rule Based Stemmer in Urdu},
author = {Vaishali Gupta and Nisheeth Joshi and Iti Mathur},
journal= {arXiv preprint arXiv:1310.0581},
year = {2013}
}
备注
In Proceedings of 4th International Conference on Computer and Communication Technology