深度伪造环境音频的检测
声音
2024-06-14 v2 音频与语音处理
摘要
随着深度生成模型质量的不断提升,能够辨别手头音频数据是录制的还是合成的变得日益重要。尽管对伪造语音信号的检测已被广泛研究,但对伪造环境音频的检测却并非如此。我们提出了一种基于CLAP音频嵌入的简单高效流水线,用于检测伪造环境声音。我们使用来自2023年DCASE挑战赛Foley声音合成任务的音频数据评估了该检测器。我们的实验表明,由44个最先进的合成器生成的伪造声音平均能以98%的准确率被检测出来。我们表明,使用在环境音频上学习的音频嵌入比标准的VGGish嵌入更有优势,因为它使检测性能提高了10%。对假阴性例子的非正式聆听揭示了检测器遗漏的伪造声音的可听特征,如失真和不合理的背景噪声。
引用
@article{arxiv.2403.17529,
title = {Detection of Deepfake Environmental Audio},
author = {Hafsa Ouajdi and Oussama Hadder and Modan Tailleur and Mathieu Lagrange and Laurie M. Heller},
journal= {arXiv preprint arXiv:2403.17529},
year = {2024}
}