中文

基于 LVLMs 的跨域图像深度伪造检测中的证据打包

计算机视觉与模式识别 2026-03-19 v1

摘要

图像深度伪造检测 (IDD) 通过捕捉合成或篡改的痕迹来区分人造图像与真实图像。虽然大型视觉-语言模型 (LVLMs) 提供强大的图像理解能力,但将其应用于 IDD 往往需要高成本的微调且对多样化、不断演化的操纵方式泛化性差。我们提出了语义一致证据打包 (SCEP),一个无需训练的 LVLMs 框架,取代整图像推理,采用证据驱动的推理。SCEP 挖掘一组紧凑的可疑 patch token,这些 token 最能揭示操纵线索。它将视觉编码器的 CLS token 作为全局参考,聚类 patch 特征以形成连贯的组别,并融合 CLS 指导的语义不匹配与频率和噪声基准异常评分 patch。为覆盖分散痕迹并避免冗余,SCEP 按每组抽取少数高置信度 patch 并应用基于网格的 NMS,生成一个证据包,用于条件化冻结的 LVLMs 进行预测。实验表明,SCEP 在多样化基准上超越了强大基线,且无需 LVLMs 微调。

关键词

引用

@article{arxiv.2603.17761,
  title  = {Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs},
  author = {Yuxin Liu and Fei Wang and Kun Li and Yiqi Nie and Junjie Chen and Zhangling Duan and Zhaohong Jia},
  journal= {arXiv preprint arXiv:2603.17761},
  year   = {2026}
}