SAFE 挑战系统:面向鲁棒音频深度伪造检测的多语言数据集集成策略
音频与语音处理
2025-10-08 v2 机器学习
摘要
SAFE 挑战评估合成语音检测在三个任务上的表现:未经处理的音频、带压缩伪影的处理音频以及旨在规避检测的洗脱音频。我们系统性地探索自监督学习 (SSL) 前端、训练数据组成以及音频长度配置,以实现稳健的深度伪造检测。我们的 AASIST-based 方法采用 WavLM large 前端搭配 RawBoost 数据增强,训练数据来自跨越 9 种语言、超过 70 种 TTS 系统的多语言数据集,包括 CodecFake、MLAAD v5、SpoofCeleb、Famous Figures 和 MAILABS。通过对不同 SSL 前端、三个训练数据版本和两种音频长度进行大量实验,我们在两个任务中均取得第二名:任务 1(未经处理音频检测)和任务 3(洗脱音频检测),展现出强大的泛化能力和鲁棒性。
引用
@article{arxiv.2508.20983,
title = {Multilingual Dataset Integration Strategies for Robust Audio Deepfake Detection: A SAFE Challenge System},
author = {Hashim Ali and Surya Subramani and Lekha Bollinani and Nithin Sai Adupa and Sali El-Loh and Hafiz Malik},
journal= {arXiv preprint arXiv:2508.20983},
year = {2025}
}
备注
Accepted @ IEEE ASRU 2025