中文

DFADD:基于扩散与流匹配的音频深度伪造数据集

声音 2024-09-16 v1 音频与语音处理

摘要

主流的零样本文本到语音(TTS)生成系统,如Voicebox和Seed-TTS,分别利用流匹配和扩散模型实现了与人类相媲美的语音。不幸的是,人类水平的音频合成导致了身份滥用和信息安全问题。目前,已有许多反欺骗模型被开发出来以对抗深度伪造音频。然而,当前最先进的反欺骗模型在对抗由基于扩散和流匹配的TTS系统合成的音频时的有效性仍未知。在本文中,我们提出了基于扩散与流匹配的音频深度伪造(DFADD)数据集。DFADD数据集收集了基于先进扩散和流匹配TTS模型的深度伪造音频。此外,我们揭示了当前的反欺骗模型对于由扩散和流匹配TTS系统生成的高度类似人类的音频缺乏足够的鲁棒性。所提出的DFADD数据集填补了这一空白,并为开发更具鲁棒性的反欺骗模型提供了宝贵资源。

关键词

引用

@article{arxiv.2409.08731,
  title  = {DFADD: The Diffusion and Flow-Matching Based Audio Deepfake Dataset},
  author = {Jiawei Du and I-Ming Lin and I-Hsiang Chiu and Xuanjun Chen and Haibin Wu and Wenze Ren and Yu Tsao and Hung-yi Lee and Jyh-Shing Roger Jang},
  journal= {arXiv preprint arXiv:2409.08731},
  year   = {2024}
}

备注

Accepted by IEEE SLT 2024