中文

面向双语多模态虚假信息检测与定位的可解释方法

计算机视觉与模式识别 2025-12-10 v3

摘要

随着多模态内容逼真度的提升,虚假信息变得更加隐蔽且难以检测,尤其是在新闻媒体中常将图像与双语字幕(如中文-英文)配合呈现。此类内容常包含局部图像编辑和跨语言不一致,二者共同扭曲信息内容,却在表面上显得合理。我们引入 BiMi 框架,实现区域级定位、跨模态和跨语言一致性检测以及自然语言解释。为支持泛化,BiMi 集成了在线检索模块,通过外部最新语境补充模型推理。我们进一步发布 BiMiBench,一个大规模且全面的基准数据集,通过系统性编辑真实新闻图像和字幕构建,包含 104,000 样本,涵盖视觉与语言模态的真实操控。为提升可解释性,我们应用组相对政策优化 (GRPO) 改进解释质量,这是该领域首次使用 GRPO。大量实验表明,BiMi 在分类准确率提升最高可达 +8.9,定位准确率提升 +15.9,解释 BERTScore 提升 +2.5,显著超越现有方法,在真实多语言虚假信息检测方面实现最新业绩。代码、模型和数据集将公开释放。

关键词

引用

@article{arxiv.2506.22930,
  title  = {Towards Explainable Bilingual Multimodal Misinformation Detection and Localization},
  author = {Yiwei He and Zhenglin Huang and Haiquan Wen and Tianxiao Li and Yi Dong and Hao Fei and Baoyuan Wu and Guangliang Cheng},
  journal= {arXiv preprint arXiv:2506.22930},
  year   = {2025}
}