中文

基于一致性学习检测和定位多模态媒体篡改

计算机视觉与模式识别 2025-06-09 v1

摘要

为应对假新闻的威胁,检测和定位多模态媒体篡改(DGM4)任务受到越来越多的关注。然而,大多数最先进的方法未充分探索局部内容中的细粒度一致性,导致对详细篡改的感知不足且结果不可靠。本文提出一种新方法,称为情境语义一致性学习(Contextual-Semantic Consistency Learning, CSCL),以增强对 DGM4 细粒度篡改感知能力。为图像和文本两种模态各构建两个分支,每个分支包含两个级联解码器:情境一致性解码器(Contextual Consistency Decoder, CCD)和语义一致性解码器(Semantic Consistency Decoder, SCD),分别捕获单模态内的情境一致性和跨模态的语义一致性。CCD 和 SCD 均遵循相同的标准以捕获细粒度篡改细节。具体而言,每个模块首先通过利用每个 token 对的异构信息的额外监督来构建一致性特征。然后,采用基于一致性特征的篡改感知推理或聚合,以深入寻找篡改线索。在 DGM4 数据集上的大量实验表明,CSCL 实现了新的状态突破,尤其在定位被篡改内容方面表现尤为突出。代码与模型参数可在 https://github.com/liyih/CSCL 获取。

关键词

引用

@article{arxiv.2506.05890,
  title  = {Unleashing the Potential of Consistency Learning for Detecting and Grounding Multi-Modal Media Manipulation},
  author = {Yiheng Li and Yang Yang and Zichang Tan and Huan Liu and Weihua Chen and Xu Zhou and Zhen Lei},
  journal= {arXiv preprint arXiv:2506.05890},
  year   = {2025}
}

备注

Accepted by CVPR 2025