利用 Transformers 与 TF-IDF 检测 COVID-19 阴谋论
计算与语言
2022-05-03 v1 机器学习
摘要
在社交媒体上分享假新闻与阴谋论具有广泛的负面影响。通过设计并应用不同的机器学习模型,研究者已在从文本中检测假新闻方面取得进展。然而,现有研究严重侧重于通用的、常识性假新闻,而现实中假新闻常涉及快速变化的主题与领域特定词汇。在本文中,我们呈现了针对 MediaEval benchmark 2021 中三个特别涉及 COVID-19 相关主题的假新闻检测任务的方法与结果。我们尝试了一组基于文本的模型,包括 Support Vector Machines、Random Forest、BERT 与 RoBERTa。我们发现预训练的 transformer 取得了最佳验证结果,但随机初始化的 transformer 配合巧妙设计也可训练至接近预训练 transformer 的准确率。
引用
@article{arxiv.2205.00377,
title = {Detecting COVID-19 Conspiracy Theories with Transformers and TF-IDF},
author = {Haoming Guo and Tianyi Huang and Huixuan Huang and Mingyue Fan and Gerald Friedland},
journal= {arXiv preprint arXiv:2205.00377},
year = {2022}
}