中文

检测与定位多模态媒体操纵

计算机视觉与模式识别 2023-04-06 v1

摘要

虚假信息已成为一个紧迫问题。视觉与文本形式的假媒体在网页上广泛传播。尽管已提出多种深度伪造检测与文本假新闻检测方法,但它们仅针对基于二分类的单模态伪造,更不用说分析和推理跨不同模态的细微伪造痕迹。在本文中,我们提出多模态假媒体的一个新研究问题,即检测与定位多模态媒体操纵(DGM^4)。DGM^4 旨在不仅检测多模态媒体的真实性,还定位被操纵的内容(即图像边界框与文本词元),这需要对多模态媒体操纵进行更深层次的推理。为支持大规模研究,我们构建了首个 DGM^4 数据集,其中图像-文本对经由多种方法操纵,并带有丰富的多样化操纵标注。此外,我们提出一种新颖的层次化多模态操纵推理Transformer(HAMMER),以充分捕捉不同模态间的细粒度交互。HAMMER 执行 1)两个单模态编码器之间的操纵感知对比学习作为浅层操纵推理,以及 2)通过多模态聚合器的模态感知交叉注意力作为深层操纵推理。基于交互的多模态信息,从浅层到深层集成了专用的操纵检测与定位头。最后,我们为该新问题建立了广泛的基准并设定了严格的评估指标。综合实验证明了我们模型的优越性;同时也揭示了若干有价值的发现,以促进未来多模态媒体操纵的研究。

关键词

引用

@article{arxiv.2304.02556,
  title  = {Detecting and Grounding Multi-Modal Media Manipulation},
  author = {Rui Shao and Tianxing Wu and Ziwei Liu},
  journal= {arXiv preprint arXiv:2304.02556},
  year   = {2023}
}

备注

CVPR 2023. Project page: https://rshaojimmy.github.io/Projects/MultiModal-DeepFake Code: https://github.com/rshaojimmy/MultiModal-DeepFake