中文

用于 Deepfake 检测的深层卷积池化 Transformer

计算机视觉与模式识别 2023-03-30 v4 人工智能

摘要

近来,由于社交媒体数字取证中的安全与隐私问题,Deepfake 引起了公众的广泛关注。随着互联网上广泛传播的 Deepfake 视频变得愈发逼真,传统检测技术已无法区分真实与伪造。现有大多数深度学习方法主要以卷积神经网络为骨干,关注人脸图像内部的局部特征与关系。然而,局部特征与关系不足以让模型学习到足够的通用信息以进行 Deepfake 检测。因此,现有 Deepfake 检测方法在进一步提升检测性能上已遇到瓶颈。为解决此问题,我们提出一种深层卷积 Transformer,以同时纳入局部与全局的决定性图像特征。具体而言,我们应用卷积池化与重注意力来丰富提取的特征并提升效能。此外,我们在模型训练中使用了甚少被讨论的图像关键帧以提升性能,并可视化了由视频压缩引起的关键帧与正常图像帧之间的特征数量差距。我们最终通过在多个 Deepfake 基准数据集上的大量实验展示了可迁移性。所提出的方案在数据集内与跨数据集实验中均持续优于多个最先进的基线。

关键词

引用

@article{arxiv.2209.05299,
  title  = {Deep Convolutional Pooling Transformer for Deepfake Detection},
  author = {Tianyi Wang and Harry Cheng and Kam Pui Chow and Liqiang Nie},
  journal= {arXiv preprint arXiv:2209.05299},
  year   = {2023}
}

备注

Accepted to be published in ACM TOMM