仅含单说话人单风格训练数据场景下的多说话人多风格语音合成
音频与语音处理
2021-12-24 v1 声音
摘要
在现有跨说话人风格迁移任务中,需具有多风格录音的源说话人向目标说话人提供风格。然而,单一说话人难以表达所有预期风格。本文提出一项更通用的任务:从多说话人语料库(其中每位说话人具有独特风格)组合任意风格与音色以生成富有表现力的语音。为实现该任务,提出一种新方法。该方法基于 Tacotron2 框架,但带有细粒度基于文本的韵律预测模块与说话人身份控制器。实验表明,所提方法可成功以另一说话人音色表达某一说话人风格,摆脱对单说话人多风格语料的依赖。此外,韵律预测模块中使用的显式韵律特征可通过调节其特征值增加合成语音的多样性。
引用
@article{arxiv.2112.12743,
title = {Multi-speaker Multi-style Text-to-speech Synthesis With Single-speaker Single-style Training Data Scenarios},
author = {Qicong Xie and Tao Li and Xinsheng Wang and Zhichao Wang and Lei Xie and Guoqiao Yu and Guanglu Wan},
journal= {arXiv preprint arXiv:2112.12743},
year = {2021}
}
备注
submitted to icassp2022