从图像模态角度重述整体故事:增强多模态虚假信息检测中的表现
计算机视觉与模式识别
2025-11-11 v1 计算与语言
多媒体
摘要
多模态虚假信息检测(MMD)指的是检测涉及虚假信息的社交媒体帖子,其中帖子常包含文本和图像模态。然而,观察 MMD 帖子可知,文本模态可能比图像模态更具信息性,因为文本通常描述了当前帖子的整体事件/故事,而图像仅呈现部分场景。我们的初步经验结果表明,图像模态恰好对 MMD 贡献较小。基于此思想,我们提出了一种新的 MMD 方法,名为 RETSIMD。具体而言,我们假设每个文本可以被划分为若干片段,而每个文本片段描述的部分场景可以由图像呈现。因此,我们将文本划分为一序列片段,并将这些片段输入预训练的文本到图像生成器,以增强一序列图像。我们进一步融合两个关于文本-图像和图像-标签互信息的辅助目标,并在辅助文本到图像生成基准数据集上进一步微调生成器。此外,我们提出了一种图结构,通过定义图像之间的三种启发式关系,并使用图神经网络生成融合特征。大量经验结果验证了 RETSIMD 的有效性。
引用
@article{arxiv.2511.06284,
title = {Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective},
author = {Bing Wang and Ximing Li and Yanjun Wang and Changchun Li and Lin Yuanbo Wu and Buyu Wang and Shengsheng Wang},
journal= {arXiv preprint arXiv:2511.06284},
year = {2025}
}
备注
Accepted by AAAI 2026. 13 pages, 6 figures. Code: https://github.com/wangbing1416/RETSIMD