Learn2Sing 2.0:基于扩散与互信息、从歌唱教师学习的目标说话人歌唱声音合成
声音
2022-05-27 v2 音频与语音处理
摘要
为非擅长歌唱者构建高质量歌唱语料库并非易事,因而难以为其创建歌唱声音合成器。Learn2Sing 致力于通过向他人(即歌唱教师)录制的数据学习,来合成无该说话人歌唱数据时的歌唱声音。受音高是区分歌唱与说话声音的关键风格因素这一事实启发,所提 Learn2Sing 2.0 首先以音素级平均音高值生成初步声学特征,使得该过程对不同风格(即说话或歌唱)的训练除说话人信息外共享相同条件。随后,在特定风格条件下,采用扩散解码器逐步恢复最终声学特征,该解码器在推理阶段由快速采样算法加速。训练中,为避免说话人嵌入与风格嵌入的信息混淆,采用互信息约束说话人嵌入与风格嵌入的学习。实验表明,所提方法能够在无歌唱数据情况下以 10 步解码为目标说话人合成高质量歌唱声音。
引用
@article{arxiv.2203.16408,
title = {Learn2Sing 2.0: Diffusion and Mutual Information-Based Target Speaker SVS by Learning from Singing Teacher},
author = {Heyang Xue and Xinsheng Wang and Yongmao Zhang and Lei Xie and Pengcheng Zhu and Mengxiao Bi},
journal= {arXiv preprint arXiv:2203.16408},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022