通过缩略图布局学习时空不一致性用于人脸深度伪造检测
计算机视觉与模式识别
2024-03-21 v2
摘要
深度伪造对社会和网络安全构成严重威胁,引发了公众的广泛担忧,推动了深度伪造视频检测领域的努力。当前的视频级方法主要基于{3D CNN},虽然取得了良好的性能,但计算需求高。本文引入一种简洁而有效的策略,称为缩略图布局(Thumbnail Layout,TALL),将视频剪辑转换为预定义布局,以实现时空依赖性的保存。该转换过程涉及依次在每个帧的相同位置对帧进行遮蔽。这些帧随后被调整为子帧并重新组织到预定布局中,形成缩略图。TALL具有模型中立性和显著的简单性,仅需最小的代码修改。此外,我们引入图推理模块(GRB)和语义一致性(SC)损失以强化TALL,最终形成TALL++。GRB增强了不同语义区域之间的相互作用,以捕捉语义层面的不一致线索。语义一致性损失对语义特征施加一致性约束,以提高模型的泛化能力。大量实验在内部数据集、跨数据集、扩散生成图像检测以及深度伪造生成方法识别上表明,TALL++的结果优于或相当于最先进的方法,显示示了本方法在各种深度伪造检测问题中的有效性。代码已公开于https://github.com/rainy-xu/TALL4Deepfake。
引用
@article{arxiv.2403.10261,
title = {Learning Spatiotemporal Inconsistency via Thumbnail Layout for Face Deepfake Detection},
author = {Yuting Xu and Jian Liang and Lijun Sheng and Xiao-Yu Zhang},
journal= {arXiv preprint arXiv:2403.10261},
year = {2024}
}
备注
Accepted by IJCV