中文

ESDD2:面向环境感知的语音与声音深度伪造检测挑战评估计划

声音 2026-02-06 v5

摘要

现实环境中录制的音频常包含前景语音与背景环境声音的混合信号。随着文本转语音、语音转换等生成模型的快速发展,这两种成分现在可以独立地被修改。由于未被修改的成分可能误导针对整体深度伪造音频的检测系统,而且这种分量级操作往往更自然地听起来,这些分量级操作更难被检测。为此,我们提出了CompSpoofV2数据集和一种分离增强的联合学习框架。CompSpoofV2是一个大规模精选数据集,专为分量级音频反欺骗设计,包含超过25万个音频样本,总时长约为283小时。基于CompSpoofV2数据集和分离增强的联合学习框架,我们推出了面向环境感知的语音与声音深度伪造检测挑战(ESDD2),该挑战聚焦于分量级欺骗,其中语音和环境声可能被操控或综合,从而创建更具挑战性和现实性的检测场景。该挑战将于2026年IEEE国际多媒体与实验展会(ICME 2026)期间举办。

关键词

引用

@article{arxiv.2601.07303,
  title  = {ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge Evaluation Plan},
  author = {Xueping Zhang and Han Yin and Yang Xiao and Lin Zhang and Ting Dang and Rohan Kumar Das and Ming Li},
  journal= {arXiv preprint arXiv:2601.07303},
  year   = {2026}
}