用于 ICASSP 2021 M2VoC 挑战赛的 CUHK-EE 语音克隆系统
音频与语音处理
2021-07-06 v5 声音
摘要
本文介绍了用于 ICASSP 2021 M2VoC 挑战赛的 CUHK-EE 语音克隆系统。该挑战赛提供两个普通话语音语料库:含噪声与混响的 218 说话人 AIShell-3 语料库,以及包含一男一女高质量语音的 MST 语料库。赛道 1 与赛道 2 分别提供 3 个目标说话人在不同音色与风格下的 100 与 5 条语句,参与者需合成目标说话人音色与风格的语音。我们参加赛道 1,并基于目标说话人的 100 条语句进行语音克隆。为完成任务开发了端到端语音克隆系统,包括:1. 借助强制对齐的文本与语音前端模块;2. 结合 Tacotron2 与 DurIAN 以预测梅尔谱的声学模型;3. 用于波形生成的 Hifigan 声码器。我们的系统包含三阶段:多说话人训练阶段、目标说话人自适应阶段与目标说话人合成阶段。我们的团队编号为 T17。挑战赛组织者提供的主观评价结果证明了系统的有效性。音频样本见演示页:https://daxintan-cuhk.github.io/CUHK-EE-system-M2VoC-challenge/ 。
引用
@article{arxiv.2103.04699,
title = {CUHK-EE Voice Cloning System for ICASSP 2021 M2VoC Challenge},
author = {Daxin Tan and Hingpang Huang and Guangyan Zhang and Tan Lee},
journal= {arXiv preprint arXiv:2103.04699},
year = {2021}
}