面向 ADD 2022 的时域对抗语音转换
音频与语音处理
2022-04-21 v2 密码学与安全
声音
摘要
本文描述了我们为首届音频深度合成检测挑战赛(ADD 2022)所构建的语音生成系统。首先,我们搭建了一个任意到多说话人的语音转换(VC)系统,将具有任意语言内容的源语音转换为目标说话人的伪造语音。随后,对 VC 生成的转换语音在时域进行后处理,以提升欺骗能力。实验结果表明,我们的系统对反欺骗检测器具有对抗能力,仅在音频质量与说话人相似度上有微小折损。该系统在 ADD 2022 的 Track 3.1 中排名首位,表明我们的方法对不同检测器亦具备良好泛化能力。
引用
@article{arxiv.2204.08692,
title = {Time Domain Adversarial Voice Conversion for ADD 2022},
author = {Cheng Wen and Tingwei Guo and Xingjun Tan and Rui Yan and Shuran Zhou and Chuandong Xie and Wei Zou and Xiangang Li},
journal= {arXiv preprint arXiv:2204.08692},
year = {2022}
}
备注
Accepted to ICASSP 2022