中文

面向特定人物的音视频深度伪造检测

计算机视觉与模式识别 2023-05-19 v3 声音 音频与语音处理

摘要

人脸操纵技术正飞速进步,新方法层出不穷。本工作的目标是提出一种能够应对现实世界中遇到的多种多样操纵方法与场景的深度伪造检测器。我们的核心见解是,每个人都具有合成生成器很可能无法复现的特定特征。据此,我们提取表征人物身份的视听特征,并用其构建面向特定人物(POI)的深度伪造检测器。我们利用对比学习范式来学习对每个身份最具判别力的动态人脸与音频片段嵌入。因此,当某人的视频和/或音频被操纵时,其在嵌入空间中的表示会与真实身份不一致,从而实现可靠检测。训练仅在真实说话人脸视频上进行;因此,该检测器不依赖于任何特定操纵方法,并具备最高的泛化能力。此外,我们的方法能够检测单模态(仅音频、仅视频)与多模态(音视频)攻击,并且对低质量或受损视频具有鲁棒性。在多种数据集上的实验证实,我们的方法确保了 SOTA 性能,尤其在低质量视频上。代码已公开于 https://github.com/grip-unina/poi-forensics。

关键词

引用

@article{arxiv.2204.03083,
  title  = {Audio-Visual Person-of-Interest DeepFake Detection},
  author = {Davide Cozzolino and Alessandro Pianese and Matthias Nießner and Luisa Verdoliva},
  journal= {arXiv preprint arXiv:2204.03083},
  year   = {2023}
}