中文

面向音频深度伪造检测的 SUPERB 风格自监督语音模型基准

音频与语音处理 2026-04-10 v1 人工智能 机器学习 信号处理

摘要

自监督学习(SSL)已彻底改变语音处理领域,诸如 SUPERB 等基准确立了跨各种下游任务的公平比较标准。尽管其安全性至关重要,但音频深度伪造检测仍处于这些努力之外。在本工作中,我们引入 Spoof-SUPERB,一个用于音频深度伪造检测的基准,系统评估了20个SSL模型,涵盖生成式、判别式和频谱图基架构。我们在多个域内和域外数据集上评估了这些模型。我们的结果揭示了大型判别式模型如 XLS-R、UniSpeech-SAT 和 WavLM Large 一致优于其他模型,这些模型受益于多语言预训练、说话人感知目标和模型规模。我们进一步分析了这些模型在声学退化情况下的鲁棒性,表明生成式方法会显著下降,而判别式模型则保持鲁棒性。该基准建立了可重复的基线,为确保语音系统免受音频深度伪造攻击提供了实用见解,阐明了哪些SSL表示最可靠。

关键词

引用

@article{arxiv.2603.01482,
  title  = {A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection},
  author = {Hashim Ali and Nithin Sai Adupa and Surya Subramani and Hafiz Malik},
  journal= {arXiv preprint arXiv:2603.01482},
  year   = {2026}
}

备注

Accepted at ICASSP