中文

基于神经声码器的多目标情感语音转换

音频与语音处理 2020-04-09 v1

摘要

情感语音转换(EVC)是生成富有表现力合成语音的一种途径。以往方法主要侧重于使用梅尔倒谱声码器建模一对一映射,即从一个情感状态转换到另一个情感状态。本文研究构建一种多目标 EVC(MTEVC)架构,其结合了基于深度双向长短期记忆(DBLSTM)的转换模型与神经声码器。包含丰富语言信息的音素后验图(PPGs)作为辅助输入特征被引入转换模型,提升了转换性能。为利用新近出现的神经声码器的优势,我们研究以条件 WaveNet 与基于流的 WaveNet(FloWaveNet)作为语音生成器。声码器额外接收说话人信息与情感信息作为辅助特征,并使用多说话人与多情感语音语料库进行训练。实验结果的客观指标与主观评估验证了所提 MTEVC 架构用于 EVC 的有效性。

关键词

引用

@article{arxiv.2004.03782,
  title  = {Multi-Target Emotional Voice Conversion With Neural Vocoders},
  author = {Songxiang Liu and Yuewen Cao and Helen Meng},
  journal= {arXiv preprint arXiv:2004.03782},
  year   = {2020}
}

备注

7 pages