并非天作之合——基于视听不协调的Deepfake检测与定位
计算机视觉与模式识别
2021-03-23 v3 多媒体
摘要
我们提出基于音频与视觉模态之间不相似性的deepfake视频检测方法,称为模态不协调分数。我们假设对任一模态的篡改将导致两种模态之间的不协调,例如唇形同步丢失、不自然的面部和嘴唇动作等。MDS计算为视频中音频片段与视觉片段之间不相似性分数的聚合。以分块方式为音频和视觉通道学习判别性特征,对各个模态采用交叉熵损失,并采用对比损失来建模模态间相似性。在DFDC和DeepFake-TIMIT数据集上的大量实验表明,我们的方法比SOTA方法高出达7%。我们还展示了时间伪造定位,并展示了我们的技术如何识别被篡改的视频片段。
引用
@article{arxiv.2005.14405,
title = {Not made for each other- Audio-Visual Dissonance-based Deepfake Detection and Localization},
author = {Komal Chugh and Parul Gupta and Abhinav Dhall and Ramanathan Subramanian},
journal= {arXiv preprint arXiv:2005.14405},
year = {2021}
}