CAST:用于深度伪造检测的交叉注意力时空特征融合
计算机视觉与模式识别
2026-03-17 v2
摘要
深度伪造已成为数字媒体真实性的重大威胁,增加了对能够识别细微和时间相关篡改的高级检测技术的需求。CNN擅长捕捉空间伪影,而Transformer擅长建模时间不一致性。然而,许多现有的CNN-Transformer模型独立处理空间和时间特征。特别是,基于注意力的方法通常对空间和时间特征使用独立的注意力机制,并使用平均、加法或拼接等朴素方法进行组合,限制了时空交互的深度。为了解决这一挑战,我们提出了一个统一的CAST模型,该模型利用交叉注意力以更集成的方式有效融合空间和时间特征。我们的方法允许时间特征动态地关注相关的空间区域,增强了模型检测细粒度、随时间演变的伪影(如闪烁的眼睛或扭曲的嘴唇)的能力。这种设计实现了更精确的定位和更深层的上下文理解,从而在多样且具有挑战性的场景中提升了性能。我们使用FaceForensics++、Celeb-DF、DeepfakeDetection和Deepfake Detection Challenge (DFDC)数据集在数据集内和跨数据集设置下评估了我们模型的性能,以证实我们方法的优越性。我们的模型在数据集内评估中取得了强劲性能,曲线下面积(AUC)为99.49%,准确率为97.57%。在跨数据集测试中,模型在未见过的DeepFakeDetection和DFDC数据集上分别取得了93.31%和81.25%的AUC分数。这些结果凸显了基于交叉注意力的特征融合在增强深度伪造视频检测鲁棒性方面的有效性。
引用
@article{arxiv.2506.21711,
title = {CAST: Cross-Attentive Spatio-Temporal feature fusion for deepfake detection},
author = {Aryan Thakre and Omkar Nagwekar and Vedang Talekar and Aparna Santra Biswas},
journal= {arXiv preprint arXiv:2506.21711},
year = {2026}
}
备注
Accepted and published in Knowledge-Based Systems, Elsevier (2026). https://doi.org/10.1016/j.knosys.2026.115560