测试神经语言模型在 COVID-19 misinformation 检测中的泛化能力
计算与语言
2024-02-09 v5 人工智能
机器学习
摘要
潜在危及生命的不实信息的急剧增加是 COVID-19 大流行的副产品。在计算上支持从海量相关数据中识别虚假信息对防止危害至关重要。研究者提出了许多方法来标记与 COVID-19 相关的在线不实信息。然而,这些方法主要 targeting 特定内容类型(例如新闻)或平台(例如 Twitter)。这些方法的泛化能力迄今很大程度上不明。我们在五个包含社交媒体帖子、新闻文章和科学论文的 COVID-19 不实信息数据集上评估了十五个基于 Transformer 的模型,以填补这一空白。我们表明,为 COVID-19 数据定制的分词器和模型相比通用模型并未提供显著优势。我们的研究为检测 COVID-19 不实信息的模型提供了现实评估。我们期望评估广泛的数据集与模型将有益于未来开发不实信息检测系统的研究。
引用
@article{arxiv.2111.07819,
title = {Testing the Generalization of Neural Language Models for COVID-19 Misinformation Detection},
author = {Jan Philip Wahle and Nischal Ashok and Terry Ruas and Norman Meuschke and Tirthankar Ghosal and Bela Gipp},
journal= {arXiv preprint arXiv:2111.07819},
year = {2024}
}