对抗训练的多歌手序列到序列歌声合成器
音频与语音处理
2020-06-19 v1 机器学习
声音
摘要
本文提出了一种高质量的歌声合成器,能够在可用录音有限的情况下对声音进行建模。基于序列到序列的歌声模型,我们设计了一个多歌手框架,以利用不同歌手的所有现有歌声数据。为了缓解歌手之间乐谱不平衡的问题,我们引入了歌手分类的对抗任务,使编码器输出较少依赖于歌手。此外,我们在生成的声学特征上应用了多个随机窗口判别器(MRWDs),使网络成为一个 GAN。客观和主观评估均表明,所提出的合成器能够生成比基线更高质的歌声(MOS 为 4.12 vs 3.53)。特别是,高元音的发音得到了显著增强。
引用
@article{arxiv.2006.10317,
title = {Adversarially Trained Multi-Singer Sequence-To-Sequence Singing Synthesizer},
author = {Jie Wu and Jian Luan},
journal= {arXiv preprint arXiv:2006.10317},
year = {2020}
}
备注
Submitted to INTERSPEECH2020