面向视觉语音识别的通用深度伪造检测
计算机视觉与模式识别
2025-12-01 v1
摘要
深度伪造生成技术取得了显著进展,造就了高度逼真的生成图像、视频和音频。尽管技术上颇具吸引力,但这一进展引发了严重关切,涉及操纵媒体的滥用。为此,迫切需要具备鲁棒性和可靠性的深度伪造检测。针对此目标,我们提出一种新型网络 FauxNet,基于预训练的视觉语音识别(Visual Speech Recognition, VSR)特征。通过从视频中提取时序 VSR 特征,我们识别并分离真实视频与人为制作的视频。本工作聚焦于零样本检测,即通用性检测,这是本研究的重点。FauxNet 在该设置下一致优于最新方法。在此基础上,FauxNet 能够对分辨视频生成技术进行归因——即区分视频来源于哪些生成技术。最后,我们提出了新的数据集,称为 Authentica-Vox 和 Authentica-HDTF,总计约38,000个真实与伪造视频,后者使用六种最新深度伪造生成技术创建。我们在Authentica 数据集和 FaceForensics++ 上提供了广泛分析和结果,展示了 FauxNet 的优势。Authentica 数据集将对外公开发布。
引用
@article{arxiv.2511.22443,
title = {Do You See What I Say? Generalizable Deepfake Detection based on Visual Speech Recognition},
author = {Maheswar Bora and Tashvik Dhamija and Shukesh Reddy and Baptiste Chopin and Pranav Balaji and Abhijit Das and Antitza Dantcheva},
journal= {arXiv preprint arXiv:2511.22443},
year = {2025}
}