中文

从生成到检测:面向健康虚假信息基准的多模态多任务数据集

计算与语言 2025-11-26 v2

摘要

信息爆炸和健康虚假信息对个人和社会都产生严重的负面影响,加剧了混乱并增加了对遵循建议健康措施的犹豫。近期生成式 AI 的进展能够产生逼真且类似人类的文本和图像,显著加速了虚假信息的传播并扩大了其覆盖范围,导致虚假信息传播出现警报性上升。为对抗信息爆炸,现有大多数工作专注于从社交媒体和事实核查平台开发虚假信息数据集,但面临主题覆盖范围、包含 AI 生成内容以及原始内容可获取性等局限。为此,我们提出了 MM Health——一个规模庞大的健康领域多模态虚假信息数据集,包含 34,746 篇新闻文章,涵盖文本和视觉信息。MM Health 包括人类生成的多模态信息(5,776 篇文章)和来自 various SOTA 生成式 AI 模型的 AI 生成的多模态信息(28,880 篇文章)。此外,我们对数据集进行了基准测试,针对三个任务(可靠性检查、原创性检查和细粒度 AI 检测)进行评估,表明现有 SOTA 模型在准确区分信息可靠性和来源方面仍面临挑战。该数据集旨在支持各种健康场景下的虚假信息检测,促进在多模态层面上检测人类和机器生成内容的能力。

关键词

引用

@article{arxiv.2505.18685,
  title  = {From Generation to Detection: A Multimodal Multi-Task Dataset for Benchmarking Health Misinformation},
  author = {Zhihao Zhang and Yiran Zhang and Xiyue Zhou and Liting Huang and Imran Razzak and Preslav Nakov and Usman Naseem},
  journal= {arXiv preprint arXiv:2505.18685},
  year   = {2025}
}

备注

Accepted to Findings of the Association for Computational Linguistics: EMNLP 2025