挖掘 CLIP 在可泛化深度伪造检测中的潜在能力
计算机视觉与模式识别
2025-03-27 v2
摘要
本文针对部分篡改的人脸深度伪造检测难题展开研究。这类伪造仅对特定人脸特征进行细微改动,同时保留整体上下文,相较于完全合成的面孔具有更大的检测难度。我们利用对比语言-图像预训练(CLIP)模型,具体是其 ViT-L/14 视觉编码器,开发了一种可泛化的检测方法。该方法在仅对原始模型进行极小修改的前提下,能够在多样化数据集和未知伪造技术下保持稳健性能。所提方法采用参数高效微调(PEFT)技术(如 LN-tuning)来调整模型参数的极小子集,从而保留 CLIP 的预训练知识并减少过拟合。针对人脸图像优化的定制化预处理流水线,以及包括 L2 归一化和超球面流形上度量学习在内的正则化策略,进一步增强了模型的泛化能力。该方法在 FaceForensics++ 数据集上训练,并以跨数据集方式在 Celeb-DF-v2、DFDC、FFIW 等数据集上进行评估,取得了与现有最先进方法相当乃至更优的检测精度,而后者通常复杂得多。本工作凸显了 CLIP 视觉编码器在人脸深度伪造检测中的有效性,并为未来研究建立了一个简洁而强大的基线,推动了可泛化深度伪造检测领域的发展。代码地址:https://github.com/yermandy/deepfake-detection
引用
@article{arxiv.2503.19683,
title = {Unlocking the Hidden Potential of CLIP in Generalizable Deepfake Detection},
author = {Andrii Yermakov and Jan Cech and Jiri Matas},
journal= {arXiv preprint arXiv:2503.19683},
year = {2025}
}