中文

当前语音深度伪造检测方法在现实世界中的泛化能力如何?

声音 2026-03-09 v1

摘要

近期语音合成和语音转换技术的进步大幅提升了合成音频的自然度和真实性。同时,社交媒体平台不断演化的编码、压缩和传输机制进一步掩盖了深度伪造的痕迹。这些因素 complicate 可靠检测现实环境中的深度伪造,凸显需要代表性评估基准的紧迫性。为此,我们引入 ML-ITW(Multilingual In-The-Wild),该数据集覆盖 14 种语言、7 大平台和 180 位公众人物,总计 28.39 小时音频。我们评估了三种检测范式:端到端神经模型、自监督特征基方法(SSL)和音频大语言模型(Audio LLM)。实验结果显示,在多样语言和现实声学条件下,检测性能显著下降,凸显现有检测器在实际场景中泛化能力的局限性。ML-ITW 数据集已公开提供。

关键词

引用

@article{arxiv.2603.05852,
  title  = {How Well Do Current Speech Deepfake Detection Methods Generalize to the Real World?},
  author = {Daixian Li and Jun Xue and Yanzhen Ren and Zhuolin Yi and Yihuan Huang and Guanxiang Feng and Yi Chai},
  journal= {arXiv preprint arXiv:2603.05852},
  year   = {2026}
}

备注

Submitted to Interspeech 2026