中文

REVEAL:参考导向的多模态操纵检测

计算机视觉与模式识别 2026-05-28 v1

摘要

多模态操纵检测旨在同时识别伪造的图像-文本对并定位被篡改区域,但现有方法通常依赖记忆孤立的痕迹,难以处理难以察觉的操纵痕迹或域迁移问题。受人类比较推理的启发,我们将此任务重新表述为参考导向的验证问题,通过比较查询与检索到的真实证据来评估其真实性。我们提出了 REVEAL Reference-Enabled Verification for Evidence Analysis and Localization,即以比较范式为显式设计的框架。为支持此范式,我们构建了一个大规模参考库,包含 17 万组真实的新闻图像-文本对,涵盖超过 4 万名公众人物。技术方面,REVEAL 采用差异感知融合机制捕获查询与检索证据之间的细粒度差异。此外,我们引入任务解耦的混合专家(Mixture-of-Experts, MoE)架构,联合执行实例级检测和细粒度定位,有效缓解这些异构目标之间的优化冲突。大量实验表明,REVEAL 显著优于现有 SOTA 方法,并且 notable 能够通过仅更新参考库即可实现 training-free domain adaptation,为检测不断演化的误information 提供了稳健且实用的解决方案。代码已公开于 https://anonymous.4open.science/r/REVEAL-Reference-A006。

关键词

引用

@article{arxiv.2605.28459,
  title  = {REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection},
  author = {Jun Zhou and Bingwen Hu and Yaxiong Wang and Zhedong Zheng and Yongzhen Wang and Yuchen Zhang and Ping Liu},
  journal= {arXiv preprint arXiv:2605.28459},
  year   = {2026}
}

备注

11 pages, 3 figures