中文

基于音色与风格解耦的多说话人多风格语音合成

声音 2022-11-23 v2 音频与语音处理

摘要

在多说话人多风格文本到语音(TTS)场景中,说话人音色与风格的解耦对于风格迁移十分重要。通过音色与风格的解耦,TTS系统能够为给定说话人合成训练语料中出现过的任意风格的表现力语音。然而,当前关于音色与风格解耦的研究仍存在若干不足。现有方法要么需要单说话人多风格录音(这类数据采集困难且成本高昂),要么使用复杂网络与繁琐训练方法(难以复现且难以控制风格迁移行为)。为提升音色与风格的解耦效果,并摆脱对单说话人多风格语料的依赖,本文提出一种简单而有效的音色与风格解耦方法。该方法以FastSpeech2网络为主干网络,利用显式的时长、音高与能量轨迹来表示风格。将每位说话人的数据视为独立且隔离的风格,随后向FastSpeech2网络加入说话人嵌入与风格嵌入以学习解耦表征。采用语句级音高与能量归一化来改善解耦效果。实验结果表明,所提模型能够合成训练中所见任意风格的语音,在保持极高说话人相似度的同时具备高风格相似度。

关键词

引用

@article{arxiv.2211.00967,
  title  = {Multi-Speaker Multi-Style Speech Synthesis with Timbre and Style Disentanglement},
  author = {Wei Song and Yanghao Yue and Ya-jie Zhang and Zhengchen Zhang and Youzheng Wu and Xiaodong He},
  journal= {arXiv preprint arXiv:2211.00967},
  year   = {2022}
}