非标准词作为文本分类的特征
计算与语言
2014-11-18 v2 机器学习
摘要
本文提出使用非标准词作为特征进行克罗地亚语文本分类。非标准词包括:数字、日期、缩写、缩略词、货币等。根据克罗地亚语非标准词分类法确定克罗地亚语中的非标准词。为此研究,收集了390篇文本文档,形成了包含6个类别(官方、文学、信息、通俗、教育、科学)的SKIPEZ语料库。文本分类实验在SKIPEZ语料库的三种不同表示上进行:第一种表示使用非标准词频率作为特征;第二种表示使用非标准词的统计度量(方差、变异系数、标准差等)作为特征;第三种表示结合前两种特征集。在文本分类实验中使用了朴素贝叶斯、CN2、C4.5、kNN、分类树和随机森林算法。使用第一种特征集(非标准词频率)获得了最佳分类结果,分类准确率为87%。这表明在高度屈折语言(如克罗地亚语)中,非标准词应被视为特征。基于非标准词的特征无需标准词形还原过程即可降低特征空间维度,因此应考虑将非标准词袋用于进一步的克罗地亚语文本分类实验。
引用
@article{arxiv.1408.6746,
title = {Non-Standard Words as Features for Text Categorization},
author = {Slobodan Beliga and Sanda Martinčić-Ipšić},
journal= {arXiv preprint arXiv:1408.6746},
year = {2014}
}
备注
IEEE 37th International Convention on Information and Communication Technology, Electronics and Microelectronics (MIPRO 2014), pp. 1415-1419, 2014