基于视觉Transformer与蒸馏的Deepfake检测方案
计算机视觉与模式识别
2021-04-06 v1 人工智能
摘要
Deepfake是利用生成对抗网络(GANs)或自动编码器等任何人都可以使用的生成式深度学习技术制作的篡改视频。近来,随着Deepfake视频的增多,一些由卷积神经网络构成、能够区分伪造视频以及deepfake数据集的分类器被积极构建。然而,基于CNN结构的先前研究不仅存在过拟合问题,还存在将伪造视频大量误判为真实视频的问题。本文中,我们提出一种带有蒸馏方法的视觉Transformer模型用于检测伪造视频。我们设计了一个CNN特征与基于块的位置模型,使其学习在所有位置上进行交互,以寻找伪影区域,从而解决假阴性问题。通过在Deepfake Detection (DFDC) Dataset上的对比分析,我们验证了以块嵌入作为输入的所提方案优于使用组合CNN特征的当前最优方法。在无集成技术的情况下,我们的模型在AUC上取得0.978、在f1分数上取得91.9,而先前的SOTA模型在相同条件下AUC为0.972、f1分数为90.6。
引用
@article{arxiv.2104.01353,
title = {Deepfake Detection Scheme Based on Vision Transformer and Distillation},
author = {Young-Jin Heo and Young-Ju Choi and Young-Woon Lee and Byung-Gyu Kim},
journal= {arXiv preprint arXiv:2104.01353},
year = {2021}
}
备注
7 pages, 5 figures