中文

用于深度伪造检测的自监督 Transformer

计算机视觉与模式识别 2022-03-03 v1

摘要

深度伪造技术在真实场景中的快速演进与广泛传播,要求人脸伪造检测器具备更强的泛化能力。一些工作通过捕捉与特定方法伪影无关的特征(如融合边界线索、累积上采样)来强化泛化能力。然而,这些方法的效力易受压缩等后处理操作的破坏。受迁移学习启发,在其他大规模人脸相关任务上预训练的神经网络可为深度伪造检测提供有用特征。例如,唇部运动已被证明是一种鲁棒且易迁移的高层语义特征,可从唇读任务中学习。但现有方法以监督方式预训练唇部特征提取模型,需大量人力进行数据标注,增加了获取训练数据的难度。本文提出一种基于自监督 Transformer 的音视频对比学习方法。该方法通过促使配对的视频与音频表征相近、非配对的表征相异来学习嘴部运动表征。经本方法预训练后,模型将针对深度伪造检测任务进行部分微调。大量实验表明,我们的自监督方法表现与监督预训练相当甚至更优。

关键词

引用

@article{arxiv.2203.01265,
  title  = {Self-supervised Transformer for Deepfake Detection},
  author = {Hanqing Zhao and Wenbo Zhou and Dongdong Chen and Weiming Zhang and Nenghai Yu},
  journal= {arXiv preprint arXiv:2203.01265},
  year   = {2022}
}