中文

基于多因素解耦的多说话人表现力语音合成

音频与语音处理 2023-03-15 v2 声音

摘要

本文旨在通过从其他说话人录制的参考语音中迁移风格与情感,合成目标说话人具有期望说话风格与情感的语音。我们以由文本到风格与情感 (Text2SE) 模块和风格与情感到波形 (SE2Wave) 模块组成的两阶段框架解决这一挑战性问题,二者通过神经瓶颈 (BN) 特征桥接。为进一步解决多因素(说话人音色、说话风格和情感)解耦问题,我们采用多标签二值向量 (MBV) 和互信息 (MI) 最小化,分别在 Text2SE 和 SE2Wave 模块中对提取的嵌入进行离散化并解耦这些高度纠缠的因素。此外,我们引入半监督训练策略以利用来自多说话人的数据,包括情感标注数据、风格标注数据和无标注数据。为在非平行迁移中将细粒度表达从参考更好地迁移到目标说话人,我们引入参考候选池并提出基于注意力的参考选择方法。大量实验证明了我们模型的良好设计。

关键词

引用

@article{arxiv.2211.10568,
  title  = {Multi-Speaker Expressive Speech Synthesis via Multiple Factors Decoupling},
  author = {Xinfa Zhu and Yi Lei and Kun Song and Yongmao Zhang and Tao Li and Lei Xie},
  journal= {arXiv preprint arXiv:2211.10568},
  year   = {2023}
}

备注

Accepted by ICASSP2023