神经语音合成中基于韵律瓶颈的跨说话人风格迁移
声音
2021-07-28 v1 机器学习
音频与语音处理
摘要
跨说话人风格迁移对于大规模多风格与富表现力语音合成应用至关重要。它不要求目标说话人成为表达所有风格的专家并收集相应录音用于模型训练。然而,现有风格迁移方法的性能仍远未满足实际应用需求。根本原因主要在两方面。其一,从单参考语音提取的风格嵌入难以对任意待合成文本提供细粒度且恰当的韵律信息。其二,这些模型中内容/文本、韵律与说话人音色通常高度纠缠,故自由组合这些组件(如跨说话人迁移说话风格)时难以期望满意结果。本文提出一种带显式韵律瓶颈的跨说话人风格迁移文本到语音(TTS)模型。韵律瓶颈稳健地构建负责说话风格的核心,并将韵律从内容与说话人音色中解耦,从而保障高质量跨说话人风格迁移。评估结果显示,所提方法在韵律客观度量上甚至达到与源说话人相关(SD)模型相当的性能,并在客观与主观评价中显著优于基于循环一致与 GMVAE 的基线。
引用
@article{arxiv.2107.12562,
title = {Cross-speaker Style Transfer with Prosody Bottleneck in Neural Speech Synthesis},
author = {Shifeng Pan and Lei He},
journal= {arXiv preprint arXiv:2107.12562},
year = {2021}
}
备注
in Proceedings of INTERSPEECH 2021