检测与定位多模态媒体操纵及其拓展
计算机视觉与模式识别
2023-09-26 v1
摘要
虚假信息已成为一个紧迫问题。视觉与文本形式的假媒体在网络上广泛传播。尽管已有多种深度伪造检测与文本假新闻检测方法被提出,它们仅针对单模态伪造基于二分类设计,更毋论跨不同模态分析并推理细微伪造痕迹。本文强调一个多模态假媒体的新研究问题,即检测与定位多模态媒体操纵(DGM^4)。DGM^4 旨在不仅检测多模态媒体的真实性,还定位被操纵内容,这需要对多模态媒体操纵进行更深层次推理。为支持大规模研究,我们构建了首个 DGM^4 数据集,其中图像-文本对经多种方法操纵,并带有丰富多样操纵标注。此外,我们提出一种新颖的层级多模态操纵推理 Transformer(HAMMER)以充分捕捉不同模态间的细粒度交互。HAMMER 执行 1)两个单模态编码器间作为浅层操纵推理的操纵感知对比学习,以及 2)多模态聚合器作为深层操纵推理的模态感知交叉注意力。基于交互的多模态信息,从浅到深层级集成了专门的操纵检测与定位头。为利用更细粒度的跨模态语义对齐对比学习,我们进一步整合带局部视图的操纵感知对比损失并构建了更先进的模型 HAMMER++。最后,我们为本新研究问题建立了广泛基准并设定了严格评估指标。综合实验证明了 HAMMER 与 HAMMER++ 的优越性。
引用
@article{arxiv.2309.14203,
title = {Detecting and Grounding Multi-Modal Media Manipulation and Beyond},
author = {Rui Shao and Tianxing Wu and Jianlong Wu and Liqiang Nie and Ziwei Liu},
journal= {arXiv preprint arXiv:2309.14203},
year = {2023}
}
备注
Extension of our CVPR 2023 paper: arXiv:2304.02556 Code: https://github.com/rshaojimmy/MultiModal-DeepFake