COVID-19虚假新闻检测中的模型泛化能力
计算与语言
2021-01-12 v1 人工智能
摘要
在COVID-19大流行期间,随着虚假与真实信息的激增,世界正面临前所未有的信息疫情。考虑到COVID-19虚假新闻带来的不良后果,科学界已投入力量应对。为助力这场对抗信息疫情的斗争,我们旨在通过两种独立方法,为CONSTRAINT 2021(FakeNews-19)提出的COVID-19虚假新闻检测任务构建一个鲁棒模型:1)使用鲁棒损失函数微调基于Transformer的语言模型;2)通过影响计算移除有害训练样本。我们进一步在不同COVID-19虚假信息测试集(Tweets-19)上评估模型的鲁棒性,以理解模型泛化能力。采用第一种方法,我们在共享任务上取得了98.13%的加权F1分数(W-F1),而在Tweets-19上最高仅达38.18%的W-F1。相反,通过执行影响数据清洗,我们的模型在99%清洗比例下可在Tweets-19上以权衡代价取得54.33%的W-F1分数。通过在两个COVID-19虚假新闻测试集上评估模型,我们指出了在该任务中模型泛化能力对于推进解决在线社交媒体平台COVID-19虚假新闻问题的重要性。
引用
@article{arxiv.2101.03841,
title = {Model Generalization on COVID-19 Fake News Detection},
author = {Yejin Bang and Etsuko Ishii and Samuel Cahyawijaya and Ziwei Ji and Pascale Fung},
journal= {arXiv preprint arXiv:2101.03841},
year = {2021}
}
备注
CONSTRAINT Workshop 2021 (Camera Ready Version)