中文

基于新情感语音数据集的可见与不可见情感风格迁移语音转换

声音 2021-02-12 v2 计算与语言 音频与语音处理

摘要

情感语音转换旨在转换语音中的情感韵律,同时保留语言内容与说话人身份。先前研究表明,利用以离散表示(如 one-hot 情感标签)为条件的编码器-解码器网络可解耦情感韵律,此类网络学会记忆一组固定的情感风格。本文提出一种基于变分自编码 Wasserstein 生成对抗网络(VAW-GAN)的新框架,其利用预训练的语音情感识别(SER)模型在训练与运行时推理中迁移情感风格。由此,该网络能够将可见与不可见的情感风格均迁移至新语音。我们表明,所提框架始终优于基线框架,取得了卓越性能。本文还标志着一个用于语音转换的情感语音数据集(ESD)的发布,该数据集包含多名说话人与多种语言。

关键词

引用

@article{arxiv.2010.14794,
  title  = {Seen and Unseen emotional style transfer for voice conversion with a new emotional speech dataset},
  author = {Kun Zhou and Berrak Sisman and Rui Liu and Haizhou Li},
  journal= {arXiv preprint arXiv:2010.14794},
  year   = {2021}
}

备注

Accepted by ICASSP 2021