中文

用于 ADD 2022 的带神经拼接的音频深度伪造检测系统

音频与语音处理 2022-04-21 v2 密码学与安全 声音

摘要

本文描述了我们用于 ADD 2022(首届音频深度合成检测挑战赛\cite{Yi2022ADD})的最佳系统与方法。同一系统以相似的训练方法用于 Track 3.2 的两轮评估。Track 3.2 第一轮数据由文本到语音(TTS)或语音转换(VC)算法生成,而第二轮数据由 Track 3.1 中其他参与者生成的伪造音频组成,旨在欺骗我们的系统。我们的系统使用标准 34 层 ResNet,配合多头注意力池化 \cite{india2019self} 来学习用于伪造音频与欺骗检测的判别性嵌入。我们进一步利用神经拼接提升模型的泛化能力,以便在不同任务中表现同样良好,更多细节将在后续章节说明。实验表明,我们提出的方法以 Track 3.2 中 10.1% 的等错误率(EER)优于所有其他系统。

关键词

引用

@article{arxiv.2204.08720,
  title  = {Audio Deep Fake Detection System with Neural Stitching for ADD 2022},
  author = {Rui Yan and Cheng Wen and Shuran Zhou and Tingwei Guo and Wei Zou and Xiangang Li},
  journal= {arXiv preprint arXiv:2204.08720},
  year   = {2022}
}

备注

Accepted to ICASSP 2022