NPVForensics:联合非关键音素与视素进行 Deepfake 检测
计算机视觉与模式识别
2023-06-13 v1
摘要
由深度学习赋能的 Deepfake 技术正快速演进,给社会带来新的安全担忧。现有的多模态检测方法通常捕获音视频不一致以揭露 Deepfake 视频。更严重的是,先进的 Deepfake 技术实现了关键音素-视素区域的音视频校准,达到了更真实的篡改效果,这带来了新挑战。为解决该问题,我们提出了一种挖掘非关键音素与视素之间相关性的新型 Deepfake 检测方法,称为 NPVForensics。首先,我们提出带有 Swin Transformer 的局部特征聚合块(LFA-ST),以有效构建非关键音素-视素及相应面部特征流。其次,我们设计了一种针对说话人脸细粒度运动的损失函数,以度量非关键音素-视素的演化一致性。接下来,我们设计了一个音素-视素感知模块用于跨模态特征融合与表示对齐,从而减小模态鸿沟并更好地挖掘两模态的内在互补性。最后,利用自监督预训练策略彻底学习自然视频中的音视频对应关系。以此方式,我们的模型可通过微调轻松适配下游 Deepfake 数据集。在现有基准上的大量实验表明,所提方法优于 SOTA 方法。
引用
@article{arxiv.2306.06885,
title = {NPVForensics: Jointing Non-critical Phonemes and Visemes for Deepfake Detection},
author = {Yu Chen and Yang Yu and Rongrong Ni and Yao Zhao and Haoliang Li},
journal= {arXiv preprint arXiv:2306.06885},
year = {2023}
}