VERITE:考虑单模态偏差的多模态错误信息检测鲁棒基准
计算机视觉与模式识别
2023-10-19 v3 多媒体
摘要
多媒体内容在社交媒体平台上已无处不在,导致多模态错误信息(MM)的兴起,以及亟需有效策略来检测并阻止其传播。近年来,多模态错误信息检测(MMD)的挑战已引起研究者的显著关注,主要涉及创建标注、弱标注或合成生成的训练数据集,以及开发各类深度学习 MMD 模型。然而,单模态偏差问题被忽视了:MMD 基准中特定模式与偏差可导致有偏差或单模态模型在这一本质多模态任务上优于其多模态对应模型,使进展难以评估。本研究系统调查并识别了广泛使用 MMD 基准 VMU-Twitter 与 COSMOS 中单模态偏差的存在。为解决此问题,我们引入用于 MMD 的“图像-文本对验证”(VERification of Image-TExt pairs,VERITE)基准,其纳入真实世界数据、排除“非对称多模态错误信息”并利用“模态平衡”。我们基于 Transformer 架构开展广泛比较研究,表明 VERITE 能有效解决单模态偏差,使其成为 MMD 的鲁棒评估框架。此外,我们提出一种称为跨模态硬合成错配(Crossmodal HArd Synthetic MisAlignment,CHASMA)的新方法,用于生成保留合法图像与虚假人工撰写标题间跨模态关系的真实合成训练数据。通过在训练中利用 CHASMA,我们观察到 VERITE 上预测性能持续且显著提升,准确率提高 9.2%。我们在 https://github.com/stevejpapad/image-text-verification 发布代码。
引用
@article{arxiv.2304.14133,
title = {VERITE: A Robust Benchmark for Multimodal Misinformation Detection Accounting for Unimodal Bias},
author = {Stefanos-Iordanis Papadopoulos and Christos Koutlis and Symeon Papadopoulos and Panagiotis C. Petrantonakis},
journal= {arXiv preprint arXiv:2304.14133},
year = {2023}
}