C2P-CLIP:注入类别通用提示至CLIP以增强深度伪造检测的泛化能力
计算机视觉与模式识别
2024-12-06 v2
摘要
本工作聚焦于AIGC检测,旨在开发能够识别各种类型伪造图像的通用检测器。近期研究发现,大规模预训练模型(如CLIP)与线性分类器结合,可有效用于泛化深度伪造检测。然而,两个关键问题仍未解决:1)为什么CLIP特征在线性分类器上对深度伪造检测有效;2)探索CLIP的检测潜力。在本研究中,我们通过将CLIP的检测特征解码为文本并进行词频分析,深入探讨了CLIP检测能力的内在机制。我们的发现表明,CLIP通过识别相似概念来检测深度伪造(图\ref{fig:fig1} a)。在此基础上,我们提出了类别通用提示CLIP(C2P-CLIP),将类别通用提示集成到文本编码器中,从而将类别相关概念注入图像编码器,进而增强检测性能(图\ref{fig:fig1} b)。我们的方法与原始CLIP相比,检测准确率提升了12.41%,且在测试阶段未引入额外参数。在两个广泛使用的数据集上进行的全面实验涵盖了20种生成模型,验证了所提方法的有效性,展示了最先进的性能。代码可在\url{https://github.com/chuangchuangtan/C2P-CLIP-DeepfakeDetection}获取。
引用
@article{arxiv.2408.09647,
title = {C2P-CLIP: Injecting Category Common Prompt in CLIP to Enhance Generalization in Deepfake Detection},
author = {Chuangchuang Tan and Renshuai Tao and Huan Liu and Guanghua Gu and Baoyuan Wu and Yao Zhao and Yunchao Wei},
journal= {arXiv preprint arXiv:2408.09647},
year = {2024}
}
备注
10 pages, 5 figures