中文

FakeFormer:面向可泛化深度伪造检测的高效漏洞驱动型Transformer

计算机视觉与模式识别 2024-11-26 v2

摘要

近年来,视觉Transformer(ViTs)在图像分类的通用领域取得了前所未有的成效。然而,鉴于其在深度伪造检测这一特定场景下相较于卷积神经网络(CNNs)性能较低,这些模型在该领域仍未得到充分探索。本文首先探究了为何普通ViT架构在处理面部伪造检测时表现出次优性能。我们的分析揭示,与CNN相比,ViT难以建模通常表征深度伪造的局部伪造痕迹。基于这一观察,我们提出了一种名为FakeFormer的深度伪造检测框架,该框架扩展了ViT以强制提取细微的易不一致信息。为此,我们引入了一种由易受攻击的图块引导、并专为ViT定制的显式注意力学习机制。在包括FF++、Celeb-DF、WildDeepfake、DFD、DFDCP和DFDC在内的多个知名数据集上进行了广泛实验。结果表明,FakeFormer在泛化能力和计算成本方面均优于现有最优方法,且无需大规模训练数据集。代码可在\url{https://github.com/10Ring/FakeFormer}获取。

关键词

引用

@article{arxiv.2410.21964,
  title  = {FakeFormer: Efficient Vulnerability-Driven Transformers for Generalisable Deepfake Detection},
  author = {Dat Nguyen and Marcella Astrid and Enjie Ghorbel and Djamila Aouada},
  journal= {arXiv preprint arXiv:2410.21964},
  year   = {2024}
}