基于多因素解耦的多说话人表现力语音合成
音频与语音处理
2023-03-15 v2 声音
摘要
本文旨在通过从其他说话人录制的参考语音中迁移风格与情感,合成目标说话人具有期望说话风格与情感的语音。我们以由文本到风格与情感 (Text2SE) 模块和风格与情感到波形 (SE2Wave) 模块组成的两阶段框架解决这一挑战性问题,二者通过神经瓶颈 (BN) 特征桥接。为进一步解决多因素(说话人音色、说话风格和情感)解耦问题,我们采用多标签二值向量 (MBV) 和互信息 (MI) 最小化,分别在 Text2SE 和 SE2Wave 模块中对提取的嵌入进行离散化并解耦这些高度纠缠的因素。此外,我们引入半监督训练策略以利用来自多说话人的数据,包括情感标注数据、风格标注数据和无标注数据。为在非平行迁移中将细粒度表达从参考更好地迁移到目标说话人,我们引入参考候选池并提出基于注意力的参考选择方法。大量实验证明了我们模型的良好设计。
引用
@article{arxiv.2211.10568,
title = {Multi-Speaker Expressive Speech Synthesis via Multiple Factors Decoupling},
author = {Xinfa Zhu and Yi Lei and Kun Song and Yongmao Zhang and Tao Li and Lei Xie},
journal= {arXiv preprint arXiv:2211.10568},
year = {2023}
}
备注
Accepted by ICASSP2023