统计感知的音视频深度伪造检测器
计算机视觉与模式识别
2024-07-18 v2 多媒体
声音
音频与语音处理
摘要
本文提出了一种增强的音视频深度伪造检测方法。近期的音视频深度伪造检测方法大多评估音视频特征之间的同步情况。虽然这些方法已显示出有前景的效果,但它们基于最大化/最小化孤立特征距离,而不考虑特征统计。此外,这些方法依赖复杂的深度学习架构,并且严重依赖经验性固定的超参数。为克服这些限制,我们提出了:(1)一种统计特征损失以增强模型的判别能力,而不是仅依赖特征距离;(2)使用波形来描述音频,以取代基于频率的表示;(3)对虚假性评分进行后处理归一化;(4)使用更浅层的网络以降低计算复杂度。在DFDC和FakeAVCeleb数据集上的实验表明,所提方法具有相关性。
引用
@article{arxiv.2407.11650,
title = {Statistics-aware Audio-visual Deepfake Detector},
author = {Marcella Astrid and Enjie Ghorbel and Djamila Aouada},
journal= {arXiv preprint arXiv:2407.11650},
year = {2024}
}
备注
Accepted in ICIP 2024