基于生成数据的潜在重构用于多模态虚假信息检测
计算机视觉与模式识别
2026-01-14 v3 多媒体
摘要
多模态虚假信息,例如标题与图像来源、背景或含义不符的误配图文,在数字时代构成了日益严峻的挑战。由于缺乏大规模标注的多模态虚假信息检测(MMD)数据集,近期方法依赖于通过上下文外配对或命名实体操纵(如更改姓名、日期或地点)生成的合成训练数据。然而,这些方法往往产生简单且不真实的样本,限制了其作为训练示例的效用。为解决此问题,我们引入了“MisCaption This!”,一个通过视觉-语言模型(VLM)对抗性提示生成高保真合成误配数据集框架。此外,我们引入了“潜在多模态重构”(LAMAR),一个基于Transformer的网络,用于重构真实标题的嵌入,为检测提供强大的辅助信号。我们探索了多种训练策略(端到端与大规模预训练)和集成机制(直接、掩码、门控和注意力)。大量实验表明,在“MisCaption This!”数据上训练的模型能更好地泛化到真实世界的虚假信息,而LAMAR在NewsCLIPpings、VERITE和新引入的VERITE 24/25基准上取得了新的最优结果,凸显了VLM生成数据和基于重构的网络在推进MMD方面的有效性。我们的代码可在https://github.com/stevejpapad/miscaptioned-image-reconstruction获取。
引用
@article{arxiv.2504.06010,
title = {Latent Reconstruction from Generated Data for Multimodal Misinformation Detection},
author = {Stefanos-Iordanis Papadopoulos and Christos Koutlis and Symeon Papadopoulos and Panagiotis C. Petrantonakis},
journal= {arXiv preprint arXiv:2504.06010},
year = {2026}
}