中文

健康错误信息文本分类中混合模型的比较研究

信息检索 2024-10-10 v1 人工智能 机器学习

摘要

本研究评估了机器学习(ML)和深度学习(DL)模型在检测在线社交网络(OSN)上 COVID-19 相关错误信息方面的有效性,旨在开发更有效的工具来对抗疫情期间健康错误信息的传播。研究在“COVID19-FNIR 数据集”上训练和测试了各种机器学习分类器(朴素贝叶斯、支持向量机、随机森林等)、深度学习模型(CNN、LSTM、混合 CNN+LSTM)以及预训练语言模型(DistilBERT、RoBERTa)。这些模型通过准确率、F1 分数、召回率、精确率和 ROC 进行评估,并使用了词干提取和词形还原等预处理技术。结果表明,支持向量机表现良好,F1 分数达到 94.41%。使用 Word2Vec 嵌入的深度学习模型在所有性能指标上均超过 98%(准确率、F1 分数、召回率、精确率和 ROC)。CNN+LSTM 混合模型在所有性能指标上也超过了 98%,优于 DistilBERT 和 RoBERTa 等预训练模型。我们的研究得出结论,深度学习模型和混合深度学习模型在检测 OSN 上的 COVID-19 错误信息方面比传统机器学习算法更有效。研究结果强调了先进神经网络方法和大规模预训练在错误信息检测中的重要性。

关键词

引用

@article{arxiv.2410.06311,
  title  = {A Comparative Study of Hybrid Models in Health Misinformation Text Classification},
  author = {Mkululi Sikosana and Oluwaseun Ajao and Sean Maudsley-Barton},
  journal= {arXiv preprint arXiv:2410.06311},
  year   = {2024}
}

备注

8 pages, 4 tables presented at the OASIS workshop of the ACM Hypertext and Social Media Conference 2024