中文

借助跨域语音情感识别在无情感标签数据集上实现情感可控语音合成

音频与语音处理 2021-01-19 v2 声音

摘要

神经文本到语音(TTS)方法通常需要大量高质量语音数据,这使得获取带有额外情感标签的此类数据集十分困难。本文提出一种在无情感标签 TTS 数据集上进行情感 TTS 合成的新方法。具体而言,我们所提方法由跨域语音情感识别(SER)模型和情感 TTS 模型组成。首先,我们在 SER 与 TTS 数据集上训练跨域 SER 模型。然后,利用训练好的 SER 模型预测 TTS 数据集上的情感标签,构建辅助 SER 任务并与 TTS 模型联合训练。实验结果表明,所提方法能生成具有指定情感表现力的语音,且几乎不影响语音质量。

关键词

引用

@article{arxiv.2010.13350,
  title  = {Emotion controllable speech synthesis using emotion-unlabeled dataset with the assistance of cross-domain speech emotion recognition},
  author = {Xiong Cai and Dongyang Dai and Zhiyong Wu and Xiang Li and Jingbei Li and Helen Meng},
  journal= {arXiv preprint arXiv:2010.13350},
  year   = {2021}
}

备注

icassp2021 final version