通过无监督学习规避音视频深度伪造检测数据集中的捷径
计算机视觉与模式识别
2025-05-30 v3 机器学习
声音
音频与语音处理
图像与视频处理
摘要
良好的数据集对开发和基准测试任何机器学习系统至关重要。对于安全关键应用,如深度伪造检测,这一点尤为重要——本文聚焦于此。我们揭示了两套最广泛使用的音视频深度伪造数据集受到一个先前未被识别的虚构特征的影响:开头的静默。伪造视频以极短的静默开头,仅凭这一特征,我们几乎能完美区分真实与伪造样本。因此,之前的音频-only 和音视频模型依赖伪造视频中静默的存在,从而在移除开头静默后表现更差。为规避对此类不需要的 artifacts 以及可能的其他未披露特征的依赖,我们提出将方法从监督学习转向无监督学习,即仅使用真实数据训练模型。我们展示,通过对自监督音视频表示进行对齐,可消除依赖数据集特定偏差的风险,并提高深度伪造检测的鲁棒性。
引用
@article{arxiv.2412.00175,
title = {Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning},
author = {Stefan Smeu and Dragos-Alexandru Boldisor and Dan Oneata and Elisabeta Oneata},
journal= {arXiv preprint arXiv:2412.00175},
year = {2025}
}
备注
Accepted as a highlight paper at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025