中文

面向通用深度伪造图像检测的视觉 Transformer 方法

计算机视觉与模式识别 2026-04-21 v1 人工智能 机器学习 图像与视频处理

摘要

在当今时代,我们面临着检测深度伪造图像的挑战,因为现代生成模型的快速演化以及现有方法的泛化能力较差。本文使用类似 DINOv2、AIMv2 和 OpenCLIP ViT-L/14 的视觉 Transformer 进行微调的集成,构建一种通用的方法来检测深度伪造图像。我们使用 IEEE SP Cup 2025 作为部分公开的 DF-Wild 数据集,因为该数据集包含具有挑战性和多样性操作与生成技术。我们首先在空间特征上训练 CNN 分类器进行实验。实验结果表明,我们的集成方法优于单个模型和强大的 CNN 基线,在 DF-Wild 测试集上实现了 96.77% 的 AUC 和仅 9% 的等错误率 (EER),分别比深度伪造检测算法 Effort 在 AUC 和 EER 上提升了 7.05% 和 8%。这方案在 SP Cup 中获胜,于 ICASSP 2025 上展示。

关键词

引用

@article{arxiv.2604.17376,
  title  = {Towards Generalizable Deepfake Image Detection with Vision Transformers},
  author = {Kaliki V Srinanda and M Manvith Prabhu and Hemanth K Mogilipalem and Jayavarapu S Abhinai and Vaibhav Santhosh and Aryan Herur and Deepu Vijayasenan},
  journal= {arXiv preprint arXiv:2604.17376},
  year   = {2026}
}

备注

5 pages, 9 figures, SP Cup - ICASSP 2025