中文

MLAAD:多语言音频反欺骗数据集

声音 2026-05-19 v10 音频与语音处理

摘要

本文介绍了多语言音频反欺骗数据集(MLAAD)版本 10:一个用于训练和评估音频深度伪造检测模型的合成音频数据集。该数据集包含 175 个文本转语音(TTS)模型,共计 1002.9 小时的合成语音,涵盖 54 种不同语言。为了评估该数据集,我们使用 MLAAD 训练了三个最先进的深度伪造检测模型,观察到当用作训练资源时,其表现优于 InTheWild 和 FakeOrReal 等可比数据集。此外,与著名的 ASVspoof 2019 数据集相比,MLAAD 被证明是一种互补资源。在跨越八个数据集的测试中,MLAAD 和 ASVspoof 2019 交替胜出,各自在四个数据集上表现卓越。通过发布该数据集并使训练好的模型可通过交互式 Web 服务器访问,我们旨在使反欺骗技术民主化,使其超越专家领域,并为全球打击音频欺骗和深度伪造的努力做出贡献。

关键词

引用

@article{arxiv.2401.09512,
  title  = {MLAAD: The Multi-Language Audio Anti-Spoofing Dataset},
  author = {Nicolas M. Müller and Piotr Kawa and Wei Herng Choong and Edresson Casanova and Eren Gölge and Thorsten Müller and Piotr Syga and Philip Sperl and Konstantin Böttinger},
  journal= {arXiv preprint arXiv:2401.09512},
  year   = {2026}
}

备注

IJCNN 2024