XMAD-Bench:跨域多语言音频深度伪造基准
声音
2026-01-21 v2 人工智能
计算与语言
机器学习
音频与语音处理
摘要
音频生成技术的最新进展导致深度伪造日益增多,使公众更容易受到金融诈骗、身份盗窃和虚假信息的侵害。音频深度伪造检测器有望缓解这一问题,许多近期研究报告其准确率接近99%。然而,这些方法通常在域内设置下进行测试,即训练集和测试集的深度伪造样本由相同的生成模型产生。为此,我们引入了 XMAD-Bench,一个大规模跨域多语言音频深度伪造基准,包含668.8小时的真实与深度伪造语音。在我们的新数据集中,说话人、生成方法和真实音频源在训练集和测试集之间是完全不同的。这构成了一个具有挑战性的跨域评估设置,可以在“野外”对音频深度伪造检测器进行测试。我们的域内和跨域实验表明,深度伪造检测器的域内性能通常高达100%,而同一模型的跨域性能有时仅与随机猜测相当,两者之间存在明显差距。我们的基准凸显了开发鲁棒音频深度伪造检测器的必要性,这类检测器需要在不同语言、说话人、生成方法和数据源之间保持泛化能力。我们的基准已公开发布于 https://github.com/ristea/xmad-bench/。
引用
@article{arxiv.2506.00462,
title = {XMAD-Bench: Cross-Domain Multilingual Audio Deepfake Benchmark},
author = {Ioan-Paul Ciobanu and Andrei-Iulian Hiji and Nicolae-Catalin Ristea and Paul Irofti and Cristian Rusu and Radu Tudor Ionescu},
journal= {arXiv preprint arXiv:2506.00462},
year = {2026}
}
备注
Accepted at EACL 2026