用于端到端语音合成的可控情感迁移
声音
2020-11-18 v1 音频与语音处理
摘要
从参考中学习的情感嵌入空间是编码器-解码器结构的情感文本到语音(TTS)系统中情感迁移的直接方法。然而,合成语音中迁移的情感不够准确且富有表现力,存在情感类别混淆。此外,难以选择合适的参考来传递期望的情感强度。为解决这些问题,我们提出一种基于Tacotron的新方法。首先,我们插入两个情感分类器——一个在参考编码器之后,一个在解码器输出之后——以增强情感嵌入和预测mel谱图的情感判别能力。其次,我们采用风格损失来衡量生成的与参考的mel谱图之间的差异。合成语音中的情感强度可通过调整情感嵌入的值来控制,因为情感嵌入可视为mel谱图的特征图。在情感迁移和强度控制上的实验表明,所提方法的合成语音更准确且富有表现力,情感类别混淆更少,且情感强度的控制对听者更为显著。
引用
@article{arxiv.2011.08679,
title = {Controllable Emotion Transfer For End-to-End Speech Synthesis},
author = {Tao Li and Shan Yang and Liumeng Xue and Lei Xie},
journal= {arXiv preprint arXiv:2011.08679},
year = {2020}
}