TF-IDF 特征加权方法的比较研究及其在非结构化数据集上的分析
计算与语言
2023-08-09 v1 机器学习
摘要
文本分类是将文本归类到相关类别的过程,其算法是许多自然语言处理(NLP)的核心。词频-逆文档频率(TF-IDF)与 NLP 是文本分类中应用最广泛的信息检索方法。我们研究并分析了针对非结构化数据的文本分类特征加权方法。所提模型在 IMDB 影评和 Amazon Alexa 评论数据集上考虑了 N-Grams 与 TF-IDF 两种特征进行情感分析。随后我们使用最先进的分类器来验证该方法,即支持向量机(SVM)、逻辑回归、多项式朴素贝叶斯(Multinomial NB)、随机森林、决策树和 k-近邻(KNN)。从这两种特征提取方式来看,基于 TF-IDF 特征的特征提取相比基于 N-Gram 有显著提升。TF-IDF 在随机森林分类器中获得了最高准确率(93.81%)、精确率(94.20%)、召回率(93.81%)和 F1 值(91.99%)。
引用
@article{arxiv.2308.04037,
title = {A Comparative Study on TF-IDF feature Weighting Method and its Analysis using Unstructured Dataset},
author = {Mamata Das and Selvakumar K. and P. J. A. Alphonse},
journal= {arXiv preprint arXiv:2308.04037},
year = {2023}
}
备注
10 pages, 3 figures, COLINS-2021, 5th International Conference on Computational Linguistics and Intelligent Systems, April 22-23, 2021, Kharkiv, Ukraine