Multi-Singer:基于大规模语料库的快速多歌手歌唱声音声码器
音频与语音处理
2021-12-21 v1 多媒体
声音
摘要
由于歌唱声音数据匮乏、歌手泛化能力有限以及计算成本高,高保真多歌手歌唱声音合成对神经声码器而言具有挑战性。现有开放语料库因规模和质量的不足,无法满足高保真歌唱声音合成的要求。以往的声码器难以进行多歌手建模,且在生成未见歌手的歌唱声音时会出现明显的退化。为加速社区内的歌唱声音研究,我们发布了一个大规模、多歌手的中文歌唱声音数据集 OpenSinger。为应对未见歌手建模的困难,我们提出了 Multi-Singer,一种基于生成对抗网络的快速多歌手声码器。具体而言,1)Multi-Singer 使用多频带生成器来加速训练和推理过程。2)为从声学特征(即梅尔频谱图)中捕捉并重建歌手身份,Multi-Singer 采用歌手条件判别器和条件对抗训练目标。3)为在频域频谱包络中监督歌手身份的重建,我们提出了一种辅助歌手感知损失。该联合训练方法在 GANs 中有效地作用于多歌手声音建模。实验结果验证了 OpenSinger 的有效性,并表明 Multi-Singer 在速度和质量上均优于以往方法在未见歌手歌唱声音建模上的表现。进一步的实验证明,结合 FastSpeech 2 作为声学模型,Multi-Singer 在多歌手歌唱声音合成流程中实现了很强的鲁棒性。样本可在 https://Multi-Singer.github.io/ 获取。
引用
@article{arxiv.2112.10358,
title = {Multi-Singer: Fast Multi-Singer Singing Voice Vocoder With A Large-Scale Corpus},
author = {Rongjie Huang and Feiyang Chen and Yi Ren and Jinglin Liu and Chenye Cui and Zhou Zhao},
journal= {arXiv preprint arXiv:2112.10358},
year = {2021}
}
备注
Accepted by ACM Multimedia 2021