面向双语多模态虚假信息检测与定位的可解释方法
计算机视觉与模式识别
2025-12-10 v3
摘要
随着多模态内容逼真度的提升,虚假信息变得更加隐蔽且难以检测,尤其是在新闻媒体中常将图像与双语字幕(如中文-英文)配合呈现。此类内容常包含局部图像编辑和跨语言不一致,二者共同扭曲信息内容,却在表面上显得合理。我们引入 BiMi 框架,实现区域级定位、跨模态和跨语言一致性检测以及自然语言解释。为支持泛化,BiMi 集成了在线检索模块,通过外部最新语境补充模型推理。我们进一步发布 BiMiBench,一个大规模且全面的基准数据集,通过系统性编辑真实新闻图像和字幕构建,包含 104,000 样本,涵盖视觉与语言模态的真实操控。为提升可解释性,我们应用组相对政策优化 (GRPO) 改进解释质量,这是该领域首次使用 GRPO。大量实验表明,BiMi 在分类准确率提升最高可达 +8.9,定位准确率提升 +15.9,解释 BERTScore 提升 +2.5,显著超越现有方法,在真实多语言虚假信息检测方面实现最新业绩。代码、模型和数据集将公开释放。
引用
@article{arxiv.2506.22930,
title = {Towards Explainable Bilingual Multimodal Misinformation Detection and Localization},
author = {Yiwei He and Zhenglin Huang and Haiquan Wen and Tianxiao Li and Yi Dong and Hao Fei and Baoyuan Wu and Guangliang Cheng},
journal= {arXiv preprint arXiv:2506.22930},
year = {2025}
}