中文

一种尼泊尔语基于规则的词干提取器及其在不同 NLP 应用上的性能

计算与语言 2020-02-25 v1 信息检索

摘要

词干提取是自然语言处理(NLP)的一个组成部分。它几乎是每个 NLP 应用中的预处理步骤。可以说,词干提取最重要的用途在于信息检索(IR)。尽管在英语等语言上已有大量词干提取工作,尼泊尔语词干提取仅有少数研究。本研究致力于创建一种针对尼泊尔语文本的基于规则的词干提取器。具体而言,它是一个词缀剥离系统,识别尼泊尔语语法中两类不同后缀并分别剥离。仅识别并剥离单个否定前缀(Na)。本研究聚焦于若干技术,如例外词识别、形态归一化与词变换,以提升词干提取性能。该提取器使用 Paice 方法进行内在测试,并在基于基础 tf-idf 的 IR 系统与使用多项式朴素贝叶斯分类器的初级新闻主题分类器上进行外在测试。分析了这些系统在使用与不使用该提取器时的性能差异。

关键词

引用

@article{arxiv.2002.09901,
  title  = {A Nepali Rule Based Stemmer and its performance on different NLP applications},
  author = {Pravesh Koirala and Aman Shakya},
  journal= {arXiv preprint arXiv:2002.09901},
  year   = {2020}
}

备注

5 pages, 2 figures, 3 tables