中文

基于混合机器学习算法的大数据文本分类

信息检索 2021-04-01 v1 人工智能 计算与语言 机器学习

摘要

近来,来自不同在线平台的数据呈现前所未有的增长,在体量、速度、多样性和真实性(4Vs)方面构成了大数据。鉴于大数据的非结构化本质,从中进行分析以提取有意义的信息目前对大数据分析而言是一大挑战。收集并分析非结构化文本数据可使决策者研究社交媒体平台上评论/帖子的激增情况。因此,需要自动化的数据分析来克服来自数字媒体平台的非结构化数据集的噪声与不可靠性。然而,当前所用的机器学习算法以性能为导向,侧重于基于从训练样本中学得的已知属性进行分类/预测的准确性。在大规模数据集的学习任务中,多数机器学习模型已知需要高昂的计算成本,并最终导致计算复杂性。本工作中,两种监督式机器学习算法与文本挖掘技术相结合,产生了一个由朴素贝叶斯(Naïve Bayes)与支持向量机(SVM)组成的混合模型。此举旨在提高所得结果的效率与准确性,并降低计算成本与复杂性。该系统还提供了一个开放平台,具有共同兴趣的一组人可分享其评论/消息,这些评论会被自动分类为合法或非法。这改善了用户间的对话质量。该混合模型使用 WEKA 工具与 Java 编程语言开发。结果显示,混合模型的准确率为 96.76%,而朴素贝叶斯与 SVM 模型分别为 61.45% 和 69.21%。

关键词

引用

@article{arxiv.2103.16624,
  title  = {Text Classification Using Hybrid Machine Learning Algorithms on Big Data},
  author = {D. C. Asogwa and S. O. Anigbogu and I. E. Onyenwe and F. A. Sani},
  journal= {arXiv preprint arXiv:2103.16624},
  year   = {2021}
}

备注

8 pages, 2 figures, 8 tables, Journal