面向 ICASSP 2022 ADD 挑战赛的 MSXF 语音合成系统
声音
2022-01-28 v1 人工智能
音频与语音处理
摘要
本文介绍了我们面向 2022 年音频深度合成检测(ADD)挑战赛任务 3.1 的 MSXF 语音合成(TTS)系统。我们采用端到端文本转语音系统,并在训练阶段向系统中加入约束损失。该端到端 TTS 系统为 VITS,预训练自监督模型为 wav2vec 2.0。我们还探究了语音语速与音量在欺骗中的影响。语速越快意味着音频中静音部分越少,越容易骗过检测器。我们还发现音量越小,欺骗能力越强,尽管我们在提交时对音量进行了归一化。我们的团队编号为 C2,并在该挑战赛中获得第四名。
引用
@article{arxiv.2201.11400,
title = {The MSXF TTS System for ICASSP 2022 ADD Challenge},
author = {Chunyong Yang and Pengfei Liu and Yanli Chen and Hongbin Wang and Min Liu},
journal= {arXiv preprint arXiv:2201.11400},
year = {2022}
}
备注
Deep Synthesis Detection Challenge 2022