MLAAD:多语言音频反欺骗数据集
声音
2026-05-19 v10 音频与语音处理
摘要
本文介绍了多语言音频反欺骗数据集(MLAAD)版本 10:一个用于训练和评估音频深度伪造检测模型的合成音频数据集。该数据集包含 175 个文本转语音(TTS)模型,共计 1002.9 小时的合成语音,涵盖 54 种不同语言。为了评估该数据集,我们使用 MLAAD 训练了三个最先进的深度伪造检测模型,观察到当用作训练资源时,其表现优于 InTheWild 和 FakeOrReal 等可比数据集。此外,与著名的 ASVspoof 2019 数据集相比,MLAAD 被证明是一种互补资源。在跨越八个数据集的测试中,MLAAD 和 ASVspoof 2019 交替胜出,各自在四个数据集上表现卓越。通过发布该数据集并使训练好的模型可通过交互式 Web 服务器访问,我们旨在使反欺骗技术民主化,使其超越专家领域,并为全球打击音频欺骗和深度伪造的努力做出贡献。
引用
@article{arxiv.2401.09512,
title = {MLAAD: The Multi-Language Audio Anti-Spoofing Dataset},
author = {Nicolas M. Müller and Piotr Kawa and Wei Herng Choong and Edresson Casanova and Eren Gölge and Thorsten Müller and Piotr Syga and Philip Sperl and Konstantin Böttinger},
journal= {arXiv preprint arXiv:2401.09512},
year = {2026}
}
备注
IJCNN 2024