EnvSDD:环境声深度伪造检测基准
声音
2025-09-30 v2 人工智能
音频与语音处理
摘要
音频生成系统现在能够创建非常逼真的声景,这可以增强媒体制作,但也构成了潜在风险。已有若干研究考察了语音或歌声中的深度伪造。然而,环境声具有不同的特征,这可能使得检测语音和歌声深度伪造的方法对真实世界声音的效果不佳。此外,现有的环境声深度伪造检测数据集在规模和音频类型上都很有限。为了填补这一空白,我们引入了 EnvSDD,这是首个专为该任务设计的大规模精选数据集,包含 45.25 小时的真实音频和 316.74 小时的伪造音频。测试集包含多种条件以评估泛化能力,例如未见过的生成模型和未见过的数据集。我们还提出了一种基于预训练音频基础模型的音频深度伪造检测系统。在 EnvSDD 上的结果表明,我们提出的系统优于来自语音和歌声领域的 SOTA 系统。
引用
@article{arxiv.2505.19203,
title = {EnvSDD: Benchmarking Environmental Sound Deepfake Detection},
author = {Han Yin and Yang Xiao and Rohan Kumar Das and Jisheng Bai and Haohe Liu and Wenwu Wang and Mark D Plumbley},
journal= {arXiv preprint arXiv:2505.19203},
year = {2025}
}
备注
Proceedings of Interspeech 2025