自动身份识别对音视频深度伪造的脆弱性
计算机视觉与模式识别
2023-11-30 v1 人工智能
多媒体
声音
音频与语音处理
摘要
深度伪造检测任务远未由语音或视觉研究者解决。若干公开可用的假合成视频与语音数据库被构建以辅助检测方法的发展。然而,现有数据库通常聚焦于视觉或语音模态,且未提供其深度伪造能实际冒充任何真实人物的证据。在本文中,我们提出首个真实的音视频深度伪造数据库 SWAN-DF,其中嘴唇与语音良好同步且视频具有高视觉与音频质量。我们采用公开可用的具有不同身份的 SWAN 真实视频数据集,利用 DeepFaceLab 的若干模型与混合技术进行换脸,以及 HiFiVC、DiffVC、YourTTS 和 FreeVC 模型进行语音转换,来创建音视频深度伪造。从公开语音数据集 LibriTTS,我们也利用若干最新文本转语音方法:YourTTS、Adaspeech 和 TorToiSe 创建了仅含音频深度伪造的单独数据库 LibriTTS-DF。我们展示了最先进的说话人识别系统(如 SpeechBrain 中基于 ECAPA-TDNN 的模型)对合成语音的脆弱性。类似地,我们基于 MobileFaceNet 架构的 face recognition 系统测试了若干变体的视觉深度伪造。脆弱性评估表明,通过将现有预训练深度伪造模型调优至特定身份,可成功欺骗 face 与说话人识别系统超过 90% 的时间,并获得给定人物极为逼真观感与听感的伪造视频。
引用
@article{arxiv.2311.17655,
title = {Vulnerability of Automatic Identity Recognition to Audio-Visual Deepfakes},
author = {Pavel Korshunov and Haolin Chen and Philip N. Garner and Sebastien Marcel},
journal= {arXiv preprint arXiv:2311.17655},
year = {2023}
}
备注
10 pages, 3 figures, 3 tables