探索自监督视觉变换器用于深度伪造检测:比较分析
计算机视觉与模式识别
2024-08-12 v2
摘要
本文探讨了自监督预训练视觉变换器 (ViT) 相较于监督预训练 ViT 和传统神经网络 (ConvNet) 在检测人脸深度伪造图像和视频方面的有效性。研究它们在有限训练数据下的潜在改进泛化能力和可解释性。尽管变换器架构在 various 任务中取得成功,但深度伪造检测社区对将大型 ViT 作为特征提取器持保留态度,原因在于其对大量数据需求的 perceived 限制,以及在小数据集上的泛化效果不佳。与此相比,ConvNet 已被确立为稳健的特征提取器。此外,从头训练 ViT 需要大量资源,限制了其仅能被大型公司使用。近期在 ViT 自监督学习 (SSL) 中取得的进展,如掩码自编码器和 DINOs,显示出在 diverse 任务和语义分割方面的适应性。通过利用 SSL ViT 进行深度伪造检测,仅需适度数据和部分微调,我们发现其深度伪造检测适应性和通过注意力机制的可解释性相当。此外,ViT 的部分微调是一种资源高效的选择。
引用
@article{arxiv.2405.00355,
title = {Exploring Self-Supervised Vision Transformers for Deepfake Detection: A Comparative Analysis},
author = {Huy H. Nguyen and Junichi Yamagishi and Isao Echizen},
journal= {arXiv preprint arXiv:2405.00355},
year = {2024}
}