解锁大型视觉语言模型在通用可解释深度伪造检测中的能力
计算机视觉与模式识别
2025-06-10 v2
摘要
当前大型视觉语言模型(Large Vision-Language Models, LVLMs)在理解多模态数据方面展现出惊人的能力,但由于其知识与侦 forensics 模式之间的错位,其在深度伪造检测中的潜力仍未得到充分挖掘。为此,我们提出了一个 novel 框架, unlocking LVLMs 的潜在能力用于深度伪造检测。我们的框架包括知识引导的伪造检测器(Knowledge-guided Forgery Detector, KFD)、伪造提示学习器(Forgery Prompt Learner, FPL)以及大型语言模型(Large Language Model, LLM)。KFD 用于计算图像特征与原始/深度伪造图像描述嵌入之间的相关性,从而实现伪造分类和定位。KFD 的输出随后被处理 by 伪造提示学习器,以构建细粒度的伪造提示嵌入。这些嵌入 along with 视觉和问题提示嵌入一起输入到 LLM 中,用于生成文本检测响应。在多个基准测试(包括 FF++、CDF2、DFD、DFDCP、DFDC 和 DF40)上的大量实验表明,我们的方法在 generalization performance 上超过了 state-of-the-art 方法,同时支持 multi-turn dialogue 能力。
引用
@article{arxiv.2503.14853,
title = {Unlocking the Capabilities of Large Vision-Language Models for Generalizable and Explainable Deepfake Detection},
author = {Peipeng Yu and Jianwei Fei and Hui Gao and Xuan Feng and Zhihua Xia and Chip Hong Chang},
journal= {arXiv preprint arXiv:2503.14853},
year = {2025}
}
备注
Accepted by ICML 2025