用于 COVID-19 假新闻检测与事实核查的两阶段 Transformer 模型
计算与语言
2020-11-30 v1 信息检索
机器学习
摘要
社交媒体平台在线通信技术的高速发展,导致错误信息与假新闻的泛滥式增长。假新闻在当前的 COVID-19 大流行中尤为猖獗,致使人们相信虚假且潜在有害的说法与故事。快速检测假新闻可缓解恐慌、混乱与潜在健康危害的蔓延。我们开发了一种两阶段自动化流水线,使用最先进的机器学习模型进行自然语言处理,以检测 COVID-19 假新闻。第一个模型利用一种新颖的事实核查算法,检索与用户关于特定 COVID-19 说法的主张最相关的事实。第二个模型通过计算主张与从人工整理的 COVID-19 数据集中检索到的真实事实之间的文本蕴含,来验证主张中的真实程度。该数据集基于公开可用的知识源,包含超过 5000 条 COVID-19 虚假说法与已核实解释,其中子集经内部标注与交叉验证以训练和评估我们的模型。我们评估了一系列从基于经典文本特征到更具上下文的基于 Transformer 的模型,观察到分别基于 BERT 与 ALBERT 的两阶段模型流水线取得了最佳结果。
引用
@article{arxiv.2011.13253,
title = {Two Stage Transformer Model for COVID-19 Fake News Detection and Fact Checking},
author = {Rutvik Vijjali and Prathyush Potluri and Siddharth Kumar and Sundeep Teki},
journal= {arXiv preprint arXiv:2011.13253},
year = {2020}
}