中文

SAFE 挑战系统:面向鲁棒音频深度伪造检测的多语言数据集集成策略

音频与语音处理 2025-10-08 v2 机器学习

摘要

SAFE 挑战评估合成语音检测在三个任务上的表现:未经处理的音频、带压缩伪影的处理音频以及旨在规避检测的洗脱音频。我们系统性地探索自监督学习 (SSL) 前端、训练数据组成以及音频长度配置,以实现稳健的深度伪造检测。我们的 AASIST-based 方法采用 WavLM large 前端搭配 RawBoost 数据增强,训练数据来自跨越 9 种语言、超过 70 种 TTS 系统的多语言数据集,包括 CodecFake、MLAAD v5、SpoofCeleb、Famous Figures 和 MAILABS。通过对不同 SSL 前端、三个训练数据版本和两种音频长度进行大量实验,我们在两个任务中均取得第二名:任务 1(未经处理音频检测)和任务 3(洗脱音频检测),展现出强大的泛化能力和鲁棒性。

关键词

引用

@article{arxiv.2508.20983,
  title  = {Multilingual Dataset Integration Strategies for Robust Audio Deepfake Detection: A SAFE Challenge System},
  author = {Hashim Ali and Surya Subramani and Lekha Bollinani and Nithin Sai Adupa and Sali El-Loh and Hafiz Malik},
  journal= {arXiv preprint arXiv:2508.20983},
  year   = {2025}
}

备注

Accepted @ IEEE ASRU 2025