用于 ADD 2022 的带神经拼接的音频深度伪造检测系统
音频与语音处理
2022-04-21 v2 密码学与安全
声音
摘要
本文描述了我们用于 ADD 2022(首届音频深度合成检测挑战赛\cite{Yi2022ADD})的最佳系统与方法。同一系统以相似的训练方法用于 Track 3.2 的两轮评估。Track 3.2 第一轮数据由文本到语音(TTS)或语音转换(VC)算法生成,而第二轮数据由 Track 3.1 中其他参与者生成的伪造音频组成,旨在欺骗我们的系统。我们的系统使用标准 34 层 ResNet,配合多头注意力池化 \cite{india2019self} 来学习用于伪造音频与欺骗检测的判别性嵌入。我们进一步利用神经拼接提升模型的泛化能力,以便在不同任务中表现同样良好,更多细节将在后续章节说明。实验表明,我们提出的方法以 Track 3.2 中 10.1% 的等错误率(EER)优于所有其他系统。
引用
@article{arxiv.2204.08720,
title = {Audio Deep Fake Detection System with Neural Stitching for ADD 2022},
author = {Rui Yan and Cheng Wen and Shuran Zhou and Tingwei Guo and Wei Zou and Xiangang Li},
journal= {arXiv preprint arXiv:2204.08720},
year = {2022}
}
备注
Accepted to ICASSP 2022