DiffSinger:基于浅层扩散机制的歌声合成
音频与语音处理
2022-03-23 v6 机器学习
声音
摘要
歌声合成(SVS)系统用于合成高质量且富有表现力的歌声,其中声学模型根据乐谱生成声学特征(如梅尔频谱)。以往的歌声声学模型采用简单损失(如L1和L2)或生成对抗网络(GAN)来重建声学特征,但分别存在过平滑和训练不稳定问题,阻碍了合成歌声的自然度。本文提出DiffSinger,一种基于扩散概率模型的SVS声学模型。DiffSinger是一个参数化马尔可夫链,以乐谱为条件迭代地将噪声转换为梅尔频谱。通过隐式优化变分下界,DiffSinger可稳定训练并生成逼真输出。为进一步提升音质并加速推理,我们引入浅层扩散机制以更好地利用简单损失学到的先验知识。具体而言,DiffSinger根据真实梅尔频谱与简单梅尔频谱解码器预测频谱的扩散轨迹交点,在小于总扩散步数的浅层步开始生成。此外,我们提出边界预测方法以定位交点并自适应确定浅层步。在中文歌声数据集上的评测表明DiffSinger优于最先进的SVS工作。扩展实验也证明了我们的方法在文本转语音任务(DiffSpeech)上的泛化性。音频样本:https://diffsinger.github.io。代码:https://github.com/MoonInTheRiver/DiffSinger。本工作旧标题为“Diffsinger: Diffusion acoustic model for singing voice synthesis”。
引用
@article{arxiv.2105.02446,
title = {DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism},
author = {Jinglin Liu and Chengxi Li and Yi Ren and Feiyang Chen and Zhou Zhao},
journal= {arXiv preprint arXiv:2105.02446},
year = {2022}
}
备注
SVS (DiffSinger), TTS (DiffSpeech), Shallow Diffusion Mechanism; Submitted to arxiv on 6 May 2021; Accepted by AAAI 2022