中文

一种改进的情感语音转换StarGAN:提升语音质量与数据增强效果

声音 2021-07-20 v1 人工智能 音频与语音处理

摘要

情感语音转换(EVC)旨在将源语音信号的情感风格转换为目标风格,同时保留其内容信息与说话人身份信息。以往的情感转换研究未能将情感信息与应保留的独立于情感的信息解耦,从而以整体方式对其进行转换,生成质量较低且存在语言失真的音频。为解决该失真问题,我们提出了一种新颖的StarGAN框架及两阶段训练过程,通过使用带两个编码器的自编码器作为生成对抗网络(GAN)的生成器,将情感特征与独立于情感的特征分离。所提模型在失真方面的客观与主观评价中均取得良好结果,表明其能有效降低失真。此外,在端到端语音情感识别的数据增强实验中,所提StarGAN模型相比基线StarGAN模型在Micro-F1上提升2%、Macro-F1上提升5%,表明该模型对数据增强更具价值。

关键词

引用

@article{arxiv.2107.08361,
  title  = {An Improved StarGAN for Emotional Voice Conversion: Enhancing Voice Quality and Data Augmentation},
  author = {Xiangheng He and Junjie Chen and Georgios Rizos and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2107.08361},
  year   = {2021}
}

备注

Accepted by Interspeech 2021