中文

表现型语音转换:说话人身份与情感风格迁移的联合框架

音频与语音处理 2021-10-22 v2 声音

摘要

传统语音转换(VC)聚焦于中性表达语音的说话人身份转换。我们注意到情感表达在日常交流中起着重要作用,且语音的情感风格可能依赖于说话人。本文研究联合转换说话人身份与说话人相关情感风格的技术,称为表现型语音转换。我们提出一种基于 StarGAN 的框架,以学习不同说话人间的多对多映射,其考虑说话人相关情感风格且无需平行数据。为此,我们将生成器条件化于从预训练语音情感识别(SER)模型导出的情感风格编码。实验在客观与主观评价中验证了所提框架的有效性。据我们所知,这是首个关于表现型语音转换的研究。

关键词

引用

@article{arxiv.2107.03748,
  title  = {Expressive Voice Conversion: A Joint Framework for Speaker Identity and Emotional Style Transfer},
  author = {Zongyang Du and Berrak Sisman and Kun Zhou and Haizhou Li},
  journal= {arXiv preprint arXiv:2107.03748},
  year   = {2021}
}

备注

Accepted to ASRU 2021