中文

COVIDHealth:用于分类 COVID-19 讨论的基准 Twitter 数据集和基于机器学习的 Web 应用

机器学习 2024-12-02 v1 社会与信息网络

摘要

COVID-19 大流行对身心健康产生了不利影响。在此期间,许多研究致力于从社交媒体中获取与健康相关的观点。本研究的主要目标是开发一个基于机器学习的 Web 应用,用于自动分类社交媒体上与 COVID-19 相关的讨论。为此,我们对 COVID-19 相关的 Twitter 数据进行了标注,提供了基准分类结果,并开发了一个 Web 应用。我们使用 Twitter API 收集数据,并将总共 6,667 条推文标记为五个不同的类别:健康风险、预防、症状、传播和治疗。我们使用各种特征提取方法提取特征,并将其应用于七种不同的传统机器学习算法,包括决策树、随机森林、随机梯度下降、Adaboost、K-近邻、逻辑回归和线性 SVC。此外,我们还使用了四种深度学习算法:LSTM、CNN、RNN 和 BERT 进行分类。总体而言,我们在深度学习中通过 CNN 算法达到了 90.43% 的最高 F1 分数。线性 SVC 算法表现出最高的 F1 分数(86.13%),超过了其他传统机器学习方法。我们的研究不仅有助于健康相关数据分析领域,还提供了一种有价值的基于 Web 的工具资源,用于高效的数据分类,这有助于应对公共卫生挑战并在大流行期间提高意识。我们将数据集和应用公开,可从以下链接下载:https://github.com/Bishal16/COVID19-Health-Related-Data-Classification-Website。

关键词

引用

@article{arxiv.2402.09897,
  title  = {COVIDHealth: A Benchmark Twitter Dataset and Machine Learning based Web Application for Classifying COVID-19 Discussions},
  author = {Mahathir Mohammad Bishal and Md. Rakibul Hassan Chowdory and Anik Das and Muhammad Ashad Kabir},
  journal= {arXiv preprint arXiv:2402.09897},
  year   = {2024}
}

备注

27 pages, 6 figures