中文

面向社交媒体统一多模态错误信息检测:基准数据集与基线

人工智能 2025-10-17 v2 计算机视觉与模式识别

摘要

近年来,检测社交媒体上的虚假多模态内容引起了越来越多的关注。欺骗的两种主要形式占据主导地位:人工编造的错误信息(例如谣言和误导性帖子)以及由图像合成模型或视觉语言模型生成的AI生成内容。尽管两者都具有欺骗意图,但它们通常被孤立研究。NLP研究侧重于人工编写的错误信息,而CV社区则以AI生成的伪造内容为目标。因此,现有模型通常仅专门针对单一类型的虚假内容。然而,在真实场景中,多模态帖子的类型通常是未知的,这限制了此类专用系统的有效性。为了弥合这一差距,我们构建了多模态新闻欺骗综合数据集,这是一个包含127K样本的综合基准,将来自现有资源的人工筛选错误信息与新生成的AI生成示例相结合。基于该数据集,我们提出了统一多模态虚假内容检测,这是一个旨在处理上述两种欺骗形式的框架。UMFDet利用以类别感知混合专家适配器增强的VLM骨干网络来捕获特定类别的线索,并利用归因思维链机制为定位显著欺骗信号提供隐式推理指导。大量实验表明,UMFDet在两种错误信息类型上均取得了稳健且一致的性能,优于专用基线,并为真实世界的多模态欺骗检测提供了实用解决方案。

关键词

引用

@article{arxiv.2509.25991,
  title  = {Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline},
  author = {Haiyang Li and Yaxiong Wang and Shengeng Tang and Lianwei Wu and Lechao Cheng and Zhun Zhong},
  journal= {arXiv preprint arXiv:2509.25991},
  year   = {2025}
}