中文

面向层次化韵律建模的零样图语音合成表达性研究

声音 2024-06-12 v2 音频与语音处理

摘要

近期研究在零样图语音合成中在说话人相似性方面取得了显着进展。然而,当前努力聚焦于声 timbre 的泛化,而非韵律建模,这导致合成语音的自然性和表达性有限。为此,我们引入了一个在大规模数据集上训练的新型语音合成模型,包括声 timbre 和层次化韵律建模。由于 timbre 是与表达性密切相关的全局属性,我们采用全局向量来建模说话人 timbre,同时引导韵律建模。此外,鉴于韵律包含全局一致性和局部变异,我们引入了一个扩散模型作为音高预测器,并采用韵律适配器进行层次化建模,从而进一步提升合成语音的韵律质量。实验结果表明,我们的模型不仅在保持与基线相当的 timbre 质量方面做得很好,而且在自然性和表达性方面表现更佳。

关键词

引用

@article{arxiv.2406.05681,
  title  = {Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling},
  author = {Yuepeng Jiang and Tao Li and Fengyu Yang and Lei Xie and Meng Meng and Yujun Wang},
  journal= {arXiv preprint arXiv:2406.05681},
  year   = {2024}
}

备注

5 pages, 2 figures, accepted by Interspeech2024