HiddenSinger:基于神经音频编解码与隐扩散模型的高质量歌声合成
音频与语音处理
2023-06-13 v1 人工智能
声音
信号处理
摘要
近来,去噪扩散模型在各领域的生成模型中展现出卓越性能。然而在语音领域,扩散模型用于合成时变音频在复杂性与可控性上面临局限,因为语音合成需要具有长时声学特征的极高维样本。为缓解歌声合成中模型复杂性带来的挑战,我们提出 HiddenSinger,一种利用神经音频编解码与隐扩散模型的高质量歌声合成系统。为保障高保真音频,我们引入一个音频自动编码器,可将音频编码为音频编解码的压缩表示,并从低维压缩隐向量重建高保真音频。随后,我们使用隐扩散模型从乐谱中采样隐表示。此外,我们将所提模型扩展为无监督歌声学习框架 HiddenSinger-U,以使用无标签歌声数据集训练模型。实验结果表明,我们的模型在音频质量上优于先前模型。进而,HiddenSinger-U 可仅以无标签数据训练而合成高质量特定说话人歌声。
引用
@article{arxiv.2306.06814,
title = {HiddenSinger: High-Quality Singing Voice Synthesis via Neural Audio Codec and Latent Diffusion Models},
author = {Ji-Sang Hwang and Sang-Hoon Lee and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2306.06814},
year = {2023}
}
备注
11 pages, 5 figures, 5 tables, under review