中文

AUDETER:面向开放世界的深度伪造音频检测大规模数据集

声音 2026-02-12 v2 人工智能 机器学习

摘要

语音合成系统现在能够产生高度逼真的语音,构成重大真实性挑战。尽管深度伪造检测模型已取得显著进展,但其实际效果常因训练与测试数据之间的分布迁移而受限,这种迁移由人类语音的复杂性和合成系统的快速演化驱动。现有数据集存在实语音多样性有限、对近期合成系统覆盖不足以及深伪造来源异构混合等问题,阻碍系统评估和开放世界模型训练。为解决这些问题,我们引入 AUDETER(AUdio DEepfake TEst Range),一个大规模且高度多样化的深度伪造音频数据集,包含超过 4500 小时的合成音频,由 11 个最新 TTS 模型和 10 个声码器生成,总计 300 万个片段。我们进一步观察到,大多数现有检测器默认采用二元监督训练,这可能在训练数据包含高度多样化深伪造模式时导致跨合成来源的负迁移,影响整体泛化。作为补充贡献,我们提出一种有效的基于课程学习的方法来缓解此效果。广泛实验表明,现有检测模型在 AUDETER 上难以泛化到新型深伪造和人类语音,而在 AUDETER 上训练的 XLR-based 检测器在多个基准上实现了强大的跨域性能,在野外数据集上达到 1.87% 的 EER。AUDETER 已在 GitHub 上提供。

关键词

引用

@article{arxiv.2509.04345,
  title  = {AUDETER: A Large-scale Dataset for Deepfake Audio Detection in Open Worlds},
  author = {Qizhou Wang and Hanxun Huang and Guansong Pang and Sarah Erfani and Christopher Leckie},
  journal= {arXiv preprint arXiv:2509.04345},
  year   = {2026}
}