中文

解耦情感风格与说话人身份的表达性语音转换

音频与语音处理 2022-07-22 v2 声音

摘要

表达性语音转换通过联合转换说话人身份与情感风格,实现对情感说话人的身份转换。由于语音情感的层次化结构,解耦不同说话人的情感风格具有挑战性。受近期基于变分自编码器(VAE)的说话人解耦成功启发,我们提出一种称为 StyleVC 的任意到任意表达性语音转换框架。StyleVC 旨在解耦语言内容、说话人身份、音高与情感风格信息。我们研究了利用风格编码器显式建模情感风格。在运行时,StyleVC 对任意说话人同时转换说话人身份与情感风格。实验在客观与主观评价中均验证了所提框架的有效性。

关键词

引用

@article{arxiv.2110.10326,
  title  = {Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion},
  author = {Zongyang Du and Berrak Sisman and Kun Zhou and Haizhou Li},
  journal= {arXiv preprint arXiv:2110.10326},
  year   = {2022}
}

备注

Accepted by Interspeech 2022