中文

利用模态特定特征进行多模态篡改检测与定位

计算机视觉与模式识别 2024-10-28 v2

摘要

AI 合成文本与图像已受到显著关注,尤其因多模态篡改在互联网上的广泛传播对社会造成了诸多负面影响。现有的多模态篡改检测与定位方法主要聚焦于融合视觉-语言特征以进行预测,却忽视了模态特定特征的重要性,导致次优结果。本文中,我们构建了一个简洁而新颖的基于 transformer 的框架,用于多模态篡改检测与定位任务。我们的框架在保持多模态对齐能力的同时探索模态特定特征。为此,我们引入视觉/语言预训练编码器与双分支交叉注意力(DCA)来提取并融合模态独有特征。此外,我们设计了解耦细粒度分类器(DFC)以增强模态特定特征挖掘并缓解模态竞争。而且,我们提出隐式篡改查询(IMQ),其利用可学习查询自适应聚合各模态内的全局上下文线索,从而改进伪造细节的发现。在 DGM4\rm DGM^4 数据集上的大量实验表明,相较最先进方法,我们提出的模型具有优越性能。

关键词

引用

@article{arxiv.2309.12657,
  title  = {Exploiting Modality-Specific Features For Multi-Modal Manipulation Detection And Grounding},
  author = {Jiazhen Wang and Bin Liu and Changtao Miao and Zhiwei Zhao and Wanyi Zhuang and Qi Chu and Nenghai Yu},
  journal= {arXiv preprint arXiv:2309.12657},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication. Camera-ready version and supplementary material