中文

利用文本转语音的有限数据情感语音转换:两阶段序列到序列训练

计算与语言 2021-06-10 v2

摘要

情感语音转换(EVC)旨在改变话语的情感状态,同时保留语言内容与说话人身份。本文提出一种新颖的2阶段训练策略,用于有限情感语音数据下的序列到序列情感语音转换。我们注意到所提EVC框架利用了文本转语音(TTS),因为它们共享生成高质量富有表现力语音这一共同目标。阶段1中,我们利用多说话人TTS语料库进行风格初始化,以解耦说话风格与语言内容。阶段2中,我们利用有限情感语音数据进行情感训练,学习如何从语音中解耦情感风格与语言信息。所提框架可同时实现频谱与韵律转换,并在客观与主观评测中相较最先进基线取得显著提升。

关键词

引用

@article{arxiv.2103.16809,
  title  = {Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training},
  author = {Kun Zhou and Berrak Sisman and Haizhou Li},
  journal= {arXiv preprint arXiv:2103.16809},
  year   = {2021}
}

备注

Accepted by Interspeech 2021