基于 GMM-MDN 的电话级韵律建模用于多样且可控的语音合成
声音
2024-10-30 v3 音频与语音处理
摘要
生成具有多样且平滑韵律模式的自然语音是一项具有挑战性的任务。尽管已有研究通过电话级韵律分布的随机采样来生成不同的韵律模式,但生成语音的多样性仍然非常有限,远未达到人类所能达到的水平。这主要归因于先前电话级韵律建模工作中使用了单峰分布(如单高斯)。在本工作中,我们提出一种新方法,使用基于 GMM 的混合密度网络(MDN)对电话级韵律进行建模,并通过高斯均值与方差的说话人自适应变换将其扩展至多说话人 TTS。此外,我们表明可通过从生成参考韵律的高斯分量中采样韵律,来克隆参考语音的韵律。我们在 LJSpeech 与 LibriTTS 数据集上的实验表明,所提出的基于 GMM 的 MDN 方法在单说话人与多说话人 TTS 中不仅比使用单高斯实现了显著更好的多样性,还提供了更好的自然度。韵律克隆实验表明,所提基于 GMM 的 MDN 方法的韵律相似性与近期提出的细粒度 VAE 相当,而目标说话人相似性更优。
引用
@article{arxiv.2105.13086,
title = {Phone-Level Prosody Modelling with GMM-Based MDN for Diverse and Controllable Speech Synthesis},
author = {Chenpeng Du and Kai Yu},
journal= {arXiv preprint arXiv:2105.13086},
year = {2024}
}
备注
Accepted to IEEE/ACM Transactions on Audio, Speech, and Language Processing (Volume 30)