中文

视觉 Transformer 与 CNN 在深度伪造图像检测中的跨伪造分析

计算机视觉与模式识别 2022-06-29 v1

摘要

深度伪造生成技术正以飞快的速度演进,使得创建逼真的篡改图像和视频成为可能,并危及现代社会的安宁。新且多样的技术不断出现,随之带来一个亟待面对的进一步问题,即深度伪造检测模型能否及时自我更新,以识别即便使用最新方法实施的篡改。这是一个极其复杂的问题,因为训练模型需要大量数据,而如果深度伪造生成方法过于新颖,这些数据难以获取。此外,持续重新训练网络也不可行。在本文中,我们探讨在各种深度学习技术中,是否存在一种能够将深度伪造的概念泛化到一定程度,从而不局限于训练集中所使用的一种或多种特定深度伪造生成方法。我们基于 ForgeryNet 数据集,在跨伪造场景下将 Vision Transformer 与 EfficientNetV2 进行了比较。实验表明,EfficientNetV2 更倾向于专门化,常在训练所用方法上取得更好结果,而 Vision Transformer 展现出更优的泛化能力,使其即便在面对采用新方法论生成的图像时也更为胜任。

关键词

引用

@article{arxiv.2206.13829,
  title  = {Cross-Forgery Analysis of Vision Transformers and CNNs for Deepfake Image Detection},
  author = {Davide Alessandro Coccomini and Roberto Caldelli and Fabrizio Falchi and Claudio Gennaro and Giuseppe Amato},
  journal= {arXiv preprint arXiv:2206.13829},
  year   = {2022}
}