表现型语音转换:说话人身份与情感风格迁移的联合框架
音频与语音处理
2021-10-22 v2 声音
摘要
传统语音转换(VC)聚焦于中性表达语音的说话人身份转换。我们注意到情感表达在日常交流中起着重要作用,且语音的情感风格可能依赖于说话人。本文研究联合转换说话人身份与说话人相关情感风格的技术,称为表现型语音转换。我们提出一种基于 StarGAN 的框架,以学习不同说话人间的多对多映射,其考虑说话人相关情感风格且无需平行数据。为此,我们将生成器条件化于从预训练语音情感识别(SER)模型导出的情感风格编码。实验在客观与主观评价中验证了所提框架的有效性。据我们所知,这是首个关于表现型语音转换的研究。
引用
@article{arxiv.2107.03748,
title = {Expressive Voice Conversion: A Joint Framework for Speaker Identity and Emotional Style Transfer},
author = {Zongyang Du and Berrak Sisman and Kun Zhou and Haizhou Li},
journal= {arXiv preprint arXiv:2107.03748},
year = {2021}
}
备注
Accepted to ASRU 2021