中文

跨语言 COVID-19 假新闻检测

计算与语言 2021-10-18 v2

摘要

COVID-19 疫情对全球公共卫生构成巨大威胁。与此同时,存在大量与该疫情相关的误导信息,宣扬毫无根据或不科学的论断。即便各大社交媒体和新闻机构已额外努力揭批 COVID-19 误导信息,多数事实核查信息为英文,而一些未经审核的 COVID-19 误导信息仍在其他语言中传播,威胁移民社区和发展中国家中文盲人群的健康。本文首次尝试仅利用高资源语言(英文)中经事实核查的新闻,检测低资源语言(中文)中的 COVID-19 误导信息。我们首先依据现有事实核查信息整理了一个中文真实与虚假新闻数据集。随后,提出一个名为 CrossFake 的深度学习框架,联合编码跨语言新闻正文文本并尽可能捕捉新闻内容。在我们数据集上的实证结果证明了 CrossFake 在跨语言设定下的有效性,且其优于若干单语言与跨语言假新闻检测器。数据集可在 https://github.com/YingtongDou/CrossFake 获取。

关键词

引用

@article{arxiv.2110.06495,
  title  = {Cross-lingual COVID-19 Fake News Detection},
  author = {Jiangshu Du and Yingtong Dou and Congying Xia and Limeng Cui and Jing Ma and Philip S. Yu},
  journal= {arXiv preprint arXiv:2110.06495},
  year   = {2021}
}

备注

Accepted by SDM at ICDM, data is available at https://github.com/YingtongDou/CrossFake