中文

首届环境声音深度伪造检测挑战赛:鲁棒性、评估与见解的基准测试

声音 2026-03-10 v2

摘要

音频生成领域的最新进展使得创建高度逼真的环境音景变得越来越容易,这些音景可能被滥用于制造欺骗性内容,例如虚假警报、枪声和人群声音,引发了对公共安全和信任的担忧。虽然针对语音和歌声的深度伪造检测已被广泛研究,但环境声音深度伪造检测(ESDD)仍未得到充分探索。为了推动ESDD的发展,第一届ESDD挑战赛启动,吸引了97支注册队伍,并收到了1,748份有效提交。本文介绍了任务制定、数据集构建、评估协议、基线系统以及挑战赛结果的关键见解。此外,我们分析了顶级系统中常见的架构选择和训练策略。最后,我们讨论了ESDD潜在的未来研究方向,概述了关键机遇和开放性问题,以指导该领域的后续研究。

关键词

引用

@article{arxiv.2603.04865,
  title  = {The First Environmental Sound Deepfake Detection Challenge: Benchmarking Robustness, Evaluation, and Insights},
  author = {Han Yin and Yang Xiao and Rohan Kumar Das and Jisheng Bai and Ting Dang},
  journal= {arXiv preprint arXiv:2603.04865},
  year   = {2026}
}

备注

Submitted to Interspeech 2026