基于神经声码器的多目标情感语音转换
音频与语音处理
2020-04-09 v1
摘要
情感语音转换(EVC)是生成富有表现力合成语音的一种途径。以往方法主要侧重于使用梅尔倒谱声码器建模一对一映射,即从一个情感状态转换到另一个情感状态。本文研究构建一种多目标 EVC(MTEVC)架构,其结合了基于深度双向长短期记忆(DBLSTM)的转换模型与神经声码器。包含丰富语言信息的音素后验图(PPGs)作为辅助输入特征被引入转换模型,提升了转换性能。为利用新近出现的神经声码器的优势,我们研究以条件 WaveNet 与基于流的 WaveNet(FloWaveNet)作为语音生成器。声码器额外接收说话人信息与情感信息作为辅助特征,并使用多说话人与多情感语音语料库进行训练。实验结果的客观指标与主观评估验证了所提 MTEVC 架构用于 EVC 的有效性。
引用
@article{arxiv.2004.03782,
title = {Multi-Target Emotional Voice Conversion With Neural Vocoders},
author = {Songxiang Liu and Yuewen Cao and Helen Meng},
journal= {arXiv preprint arXiv:2004.03782},
year = {2020}
}
备注
7 pages