中文

识破欺骗:利用视觉-语言模型揭示多模态新闻中的误导性创作者意图

计算机视觉与模式识别 2026-04-14 v4 计算与语言 多媒体

摘要

多模态虚假信息的影响不仅来自事实不准确,还来自创作者故意嵌入的误导性叙事。因此,解读此类创作者意图对于多模态虚假信息检测(MMD)和有效的信息治理至关重要。为此,我们推出了 DeceptionDecoded,这是一个基于可信参考文章的大规模基准,包含 12,000 对图像-标题对,使用意图引导的模拟框架创建,该框架同时模拟了创作者的期望影响和执行计划。该数据集涵盖了误导性和非误导性案例,涉及视觉和文本模态的多种操纵,并支持三个以意图为中心的任务:(1) 误导性意图检测,(2) 误导性来源归属,以及 (3) 创作者愿望推断。我们评估了 14 种最先进的视觉-语言模型(VLMs),发现它们在意图推理方面存在困难,往往依赖表面层面的对齐、风格修饰或启发式真实性信号等浅层线索。为弥合这一差距,我们的框架系统地合成数据,使模型能够学习蕴含层面的意图推理。在 DeceptionDecoded 上训练的模型在真实世界 MMD 中展现出强大的迁移能力,验证了我们的框架既是诊断 VLM 脆弱性的基准,又是为增强真实世界多模态虚假信息治理的鲁棒性提供高质量、意图聚焦资源的数据合成引擎。

关键词

引用

@article{arxiv.2505.15489,
  title  = {Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models},
  author = {Jiaying Wu and Fanxiao Li and Zihang Fu and Min-Yen Kan and Bryan Hooi},
  journal= {arXiv preprint arXiv:2505.15489},
  year   = {2026}
}

备注

ICLR 2026