中文

MCFEND:一个用于中文假新闻检测的多源基准数据集

计算与语言 2024-07-25 v2 人工智能

摘要

各种在线来源上假新闻的盛行对公众产生了重大影响。现有的中文假新闻检测数据集仅限于来源于微博的新闻。然而,源自多个来源的假新闻在内容和社交语境等各个方面表现出多样性。仅在单一新闻来源上训练的方法很难适用于现实场景。我们的初步实验表明,当测试数据更改为多源新闻数据时,从大型中文假新闻检测数据集Weibo-21中学习的SOTA方法的F1分数从0.943显著下降至0.470,未能识别出超过三分之一的多源假新闻。为了解决这一局限性,我们构建了首个用于中文假新闻检测的多源基准数据集,称为MCFEND,它由我们从社交媒体平台、通讯应用和传统在线新闻媒体等不同来源收集的新闻组成。值得注意的是,此类新闻已由全球14个权威事实核查机构进行了事实核查。此外,在我们提出的数据集上,以跨源、多源和未见源的方式对各种现有的中文假新闻检测方法进行了全面评估。MCFEND作为一个基准数据集,旨在推动现实场景中的中文假新闻检测方法。

关键词

引用

@article{arxiv.2403.09092,
  title  = {MCFEND: A Multi-source Benchmark Dataset for Chinese Fake News Detection},
  author = {Yupeng Li and Haorui He and Jin Bai and Dacheng Wen},
  journal= {arXiv preprint arXiv:2403.09092},
  year   = {2024}
}

备注

Accepted by the ACM Web Conference 2024 (WWW 2024) oral, dataset available: https://github.com/TrustworthyComp