中文

解锁大型视觉语言模型在通用可解释深度伪造检测中的能力

计算机视觉与模式识别 2025-06-10 v2

摘要

当前大型视觉语言模型(Large Vision-Language Models, LVLMs)在理解多模态数据方面展现出惊人的能力,但由于其知识与侦 forensics 模式之间的错位,其在深度伪造检测中的潜力仍未得到充分挖掘。为此,我们提出了一个 novel 框架, unlocking LVLMs 的潜在能力用于深度伪造检测。我们的框架包括知识引导的伪造检测器(Knowledge-guided Forgery Detector, KFD)、伪造提示学习器(Forgery Prompt Learner, FPL)以及大型语言模型(Large Language Model, LLM)。KFD 用于计算图像特征与原始/深度伪造图像描述嵌入之间的相关性,从而实现伪造分类和定位。KFD 的输出随后被处理 by 伪造提示学习器,以构建细粒度的伪造提示嵌入。这些嵌入 along with 视觉和问题提示嵌入一起输入到 LLM 中,用于生成文本检测响应。在多个基准测试(包括 FF++、CDF2、DFD、DFDCP、DFDC 和 DF40)上的大量实验表明,我们的方法在 generalization performance 上超过了 state-of-the-art 方法,同时支持 multi-turn dialogue 能力。

关键词

引用

@article{arxiv.2503.14853,
  title  = {Unlocking the Capabilities of Large Vision-Language Models for Generalizable and Explainable Deepfake Detection},
  author = {Peipeng Yu and Jianwei Fei and Hui Gao and Xuan Feng and Zhihua Xia and Chip Hong Chang},
  journal= {arXiv preprint arXiv:2503.14853},
  year   = {2025}
}

备注

Accepted by ICML 2025