非平行情感语音转换
机器学习
2020-04-14 v3 音频与语音处理
机器学习
摘要
我们提出一种非平行数据驱动的情感语音转换方法。它能够在保留说话人身份和语言内容的同时,迁移语音信号的情感相关特征。大多数现有方法需要平行数据和时间对齐,而这在大多数实际应用中是不可用的。我们基于无监督风格迁移技术实现非平行训练,该技术学习两个分布之间的翻译模型,而非配对样本之间的确定性一对一映射。转换模型由每个情感域的编码器和解码器组成。我们假设语音信号可在潜空间分解为情感不变的内容编码和情感相关的风格编码。情感转换通过提取并重组源语音的内容编码与目标情感的风格编码来完成。我们在包含四种情感的非平行语料库上测试了我们的方法。主观和客观评估均显示了我们方法的有效性。
引用
@article{arxiv.1811.01174,
title = {Nonparallel Emotional Speech Conversion},
author = {Jian Gao and Deep Chakraborty and Hamidou Tembine and Olaitan Olaleye},
journal= {arXiv preprint arXiv:1811.01174},
year = {2020}
}
备注
Published in INTERSPEECH 2019, 5 pages, 6 figures. Simulation available at http://www.jian-gao.org/emogan