超越人为错位:检测与定位语义协调的多模态篡改
计算机视觉与模式识别
2025-09-17 v1 人工智能
摘要
多模态数据中篡改内容的检测与定位已成为媒体取证领域的一项关键挑战。虽然现有基准展示了技术进步,但它们存在错位伪影,无法很好地反映现实世界的篡改模式:实际攻击通常保持跨模态的语义一致性,而当前数据集人为地破坏了跨模态对齐,产生了易于检测的异常。为了弥合这一差距,我们开创性地研究了语义协调篡改的检测,即视觉编辑与语义一致的文本描述系统性地配对。我们的方法首先构建了首个语义对齐多模态篡改(SAMM)数据集,该数据集通过一个两阶段流程生成:1)应用最先进的图像篡改技术,随后2)生成上下文合理的文本叙述以强化视觉欺骗。在此基础上,我们提出了一个检索增强的篡改检测与定位(RamDG)框架。RamDG首先利用外部知识库检索上下文证据,这些证据作为辅助文本,与输入一起通过我们的图像伪造定位和深度篡改检测模块进行编码,以追踪所有篡改。大量实验表明,我们的框架显著优于现有方法,在SAMM数据集上的检测准确率比最先进的方法高出2.06%。数据集和代码已公开于https://github.com/shen8424/SAMM-RamDG-CAP。
引用
@article{arxiv.2509.12653,
title = {Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations},
author = {Jinjie Shen and Yaxiong Wang and Lechao Cheng and Nan Pu and Zhun Zhong},
journal= {arXiv preprint arXiv:2509.12653},
year = {2025}
}