空间-频率注意力网络用于深度伪造检测
计算机视觉与模式识别
2025-10-07 v1 人工智能
多媒体
摘要
随着深度伪造技术的近期崛起,检测被操纵的媒体已成为迫切的议题。大多数现有方法无法在不同数据集和生成技术之间获得良好的泛化能力。因此,我们提出了一种新颖的集成框架,结合基于转换器的架构(如 Swin Transformer 和 ViT)的优势与纹理基方法,以实现更高的检测准确率和鲁棒性。该方法引入了创新的数据分割、顺序训练、频率分割、基于补丁的注意力和面部分割技术,以处理数据集不平衡问题,增强高影响区域(如眼睛和嘴巴),并提高泛化能力。我们的模型在 DFWild-Cup 数据集上测试时实现了最先进的性能,该数据集是八个深度伪造数据集的一个多样化子集。该集成受益于这些方法之间的互补性,其中转换器在全局特征提取方面表现突出,而纹理基方法则提供了可解释性。这一工作表明,混合模型可以有效应对深度伪造检测的不断演变挑战,为实际应用提供稳健的解决方案。
引用
@article{arxiv.2510.04630,
title = {SFANet: Spatial-Frequency Attention Network for Deepfake Detection},
author = {Vrushank Ahire and Aniruddh Muley and Shivam Zample and Siddharth Verma and Pranav Menon and Surbhi Madan and Abhinav Dhall},
journal= {arXiv preprint arXiv:2510.04630},
year = {2025}
}