音容同质性揭示深度伪造
计算机视觉与模式识别
2022-06-14 v3 人工智能
多媒体
摘要
由于深度伪造的滥用,检测伪造视频极具现实需求。现有检测方法致力于挖掘深度伪造视频中的特定伪影,并在特定数据上拟合良好。然而,针对这些伪影不断发展的技术持续挑战传统深度伪造检测器的鲁棒性。因此,这类方法在泛化性上的发展已陷入瓶颈。为解决此问题,鉴于深度伪造视频中声音与面孔背后的身份常不匹配、且音容具有一定同质性的经验观察,本文提出从一个未被探索的声脸匹配视角进行深度伪造检测。为此,设计了一种声脸匹配方法来度量二者的匹配程度。然而,在特定深度伪造数据集上训练会使模型过拟合某些深度伪造算法的特征。我们转而倡导一种以预训练后微调范式快速适应未知伪造的方法。具体而言,我们先在通用音视频数据集上预训练模型,再在下游深度伪造数据上微调。我们在三个广泛使用的深度伪造数据集——DFDC、FakeAVCeleb 与 DeepfakeTIMIT 上进行了充分实验。相较其他最先进对手,我们的方法获得了显著性能提升。同样值得注意的是,在有限深度伪造数据上微调时,我们的方法已取得了具竞争力的结果。
引用
@article{arxiv.2203.02195,
title = {Voice-Face Homogeneity Tells Deepfake},
author = {Harry Cheng and Yangyang Guo and Tianyi Wang and Qi Li and Xiaojun Chang and Liqiang Nie},
journal= {arXiv preprint arXiv:2203.02195},
year = {2022}
}
备注
13 pages for peer review. Code will be released at https://github.com/xaCheng1996/VFD