中文

印度与非印度语言词干提取算法综述

计算与语言 2014-04-11 v1

摘要

词干提取是文本挖掘应用中的预处理步骤,也是自然语言处理功能的常见需求。词干提取是将屈折变化的单词还原为其词干的过程。词干提取的主要目的是将单词的不同语法形式/词形(如名词、形容词、动词、副词等)还原为其词根形式。词干提取广泛应用于信息检索系统,并能减小索引文件的大小。可以说,词干提取的目标是将屈折变化形式以及有时派生相关的形式还原为共同的基形。本文讨论了针对非印度语言和印度语言的不同词干提取算法、词干提取方法、准确率及误差。

关键词

引用

@article{arxiv.1404.2878,
  title  = {Overview of Stemming Algorithms for Indian and Non-Indian Languages},
  author = {Dalwadi Bijal and Suthar Sanket},
  journal= {arXiv preprint arXiv:1404.2878},
  year   = {2014}
}