相似性高于事实性:我们在多模态超出上下文误导检测方面取得了什么进展?
计算机视觉与模式识别
2024-07-19 v1 多媒体
摘要
超出上下文 (OOC) 误导是多模态事实核查中的一个重大挑战,具体表现为图像与文本被配对,却误代表其原始上下文以支持虚假叙事。近期研究在基于证据的 OOC 检测方面呈现出日益复杂的架构趋势,融合了 Transformer、基础模型和大语言模型。在本研究中,我们引入一种简单而稳健的基线方法,即 MUSE (MUltimodal SimilaritiEs),具体测量图像-文本对与外部图像和文本证据之间的相似性。我们的结果表明,MUSE 配合决策树、随机森林和多层感知机等常规分类器,可在 NewsCLIPpings 和 VERITE 数据集上与甚至超越最新方法。此外,将 MUSE 集成到我们提出的 "注意力中间 Transformer 表示" (AITR) 中,性能在 NewsCLIPpings 和 VERITE 上的提升分别达到 3.3% 和 7.5%。然而,MUSE 的成功依赖于表层模式和捷径,却未检查事实性和逻辑不一致,这对我们如何定义该任务、构建数据集、收集外部证据以及总体上如何评估该领域的进展提出了关键问题。我们已在 https://github.com/stevejpapad/outcontext-misinfo-progress 上发布代码。
引用
@article{arxiv.2407.13488,
title = {Similarity over Factuality: Are we making progress on multimodal out-of-context misinformation detection?},
author = {Stefanos-Iordanis Papadopoulos and Christos Koutlis and Symeon Papadopoulos and Panagiotis C. Petrantonakis},
journal= {arXiv preprint arXiv:2407.13488},
year = {2024}
}