中文

音频深度伪造系统的源头追踪

音频与语音处理 2024-09-26 v1 声音

摘要

近年来,生成式 AI 技术的进展使得音频深度伪造技术显得更加逼真。虽然当前反欺诈系统的研究主要关注评估给定音频样本是假的还是真实的,但对于辨别音频深度伪造的具体技术手段的关注仍有限。常用于音频深度伪造生成的算法,如文本转语音 (TTS) 和语音转换 (VC),经历了包括输入处理、声学建模和波形生成在内的不同阶段。本文引入了一个旨在分类各种欺骗属性的系统,捕捉整个生成管道中各个模块的独特特征。我们在两个数据集上评估了该系统:ASVspoof 2019 逻辑访问数据集和多语言音频反欺诈数据集 (MLAAD)。来自两个实验的结果表明,该系统能够鲁棒地识别深度伪造生成系统的不同欺骗属性。

关键词

引用

@article{arxiv.2407.08016,
  title  = {Source Tracing of Audio Deepfake Systems},
  author = {Nicholas Klein and Tianxiang Chen and Hemlata Tak and Ricardo Casal and Elie Khoury},
  journal= {arXiv preprint arXiv:2407.08016},
  year   = {2024}
}

备注

Accepted by INTERSPEECH 2024