中文

ESDD 2026: Environmental Sound Deepfake Detection Challenge Evaluation Plan

声音 2025-12-25 v2

摘要

近期音频生成系统的进展使得能够创建高度逼真且沉浸式的声景,这些声景在电影和虚拟现实领域的应用日益增多。然而,这些音频生成器也引发了潜在滥用问题,如用于伪造视频的欺骗性音频内容以及传播误导性信息的风险。现有针对环境声深度伪造检测(ESDD)的数据集在规模和音频类型方面存在不足。为填补这一空白,我们提出了 EnvSDD——首个大规模精选数据集,用于 ESDD,包含 45.25 小时的真实音频和 316.7 小时的伪造音频。基于 EnvSDD,我们将启动环境声深度伪造检测挑战赛。具体而言,我们提出了两个不同轨道:ESDD in Unseen Generators 与 Black-Box Low-Resource ESDD,涵盖现实场景中遇到的各种挑战。该挑战赛将于 2026 年 IEEE 国际会议 on Acoustics, Speech, and Signal Processing(ICASSP 2026)期间举行。

关键词

引用

@article{arxiv.2508.04529,
  title  = {ESDD 2026: Environmental Sound Deepfake Detection Challenge Evaluation Plan},
  author = {Han Yin and Yang Xiao and Rohan Kumar Das and Jisheng Bai and Ting Dang},
  journal= {arXiv preprint arXiv:2508.04529},
  year   = {2025}
}