中文

CodecFake: 增强反欺骗模型以应对基于编解码器的语音合成系统生成的深度伪造音频

音频与语音处理 2024-06-12 v1 声音

摘要

当前最先进的基于编解码器的音频合成系统,仅需从特定未见过的说话者那里获取3秒样本,就能模仿任何人的声音。不幸的是,恶意攻击者可能会利用这些技术,导致滥用和安全问题。反欺骗模型已被开发用于检测伪造语音。然而,当前最先进的反欺骗模型能否有效应对基于编解码器的语音合成系统生成的深度伪造音频,这一开放问题仍未得到解答。在本文中,我们整理了大量当代最先进的编解码器模型,并用它们重新创建合成语音。这项工作促成了CodecFake的诞生,这是第一个基于编解码器的深度伪造音频数据集。此外,我们验证了在常用数据集上训练的反欺骗模型无法检测来自当前基于编解码器的语音生成系统的合成语音。所提出的CodecFake数据集使这些模型能够有效应对这一挑战。

关键词

引用

@article{arxiv.2406.07237,
  title  = {CodecFake: Enhancing Anti-Spoofing Models Against Deepfake Audios from Codec-Based Speech Synthesis Systems},
  author = {Haibin Wu and Yuan Tseng and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2406.07237},
  year   = {2024}
}

备注

Accepted to Interspeech 2024, project page: https://codecfake.github.io/