中文

通过操纵语音风格隐变量实现跨说话人情感迁移

声音 2023-03-16 v1 计算与语言 音频与语音处理

摘要

近年来,情感文本到语音合成取得了显著进展。然而,其需要大量标注数据,而这类数据不易获取。即便能够获得情感语音数据集,在控制情感强度方面仍存在局限。本工作中,我们提出一种利用隐风格空间中的向量运算进行跨说话人情感迁移与操纵的新方法。通过仅借助少量标注样本,我们由朗读风格语音生成情感语音,且不丢失说话人身份。此外,情感强度可通过标量值便捷控制,为用户提供了一种直观的语音操纵方式。实验结果表明,所提方法在表现力、自然度与可控性方面具有优越性能,且保留了说话人身份。

关键词

引用

@article{arxiv.2303.08329,
  title  = {Cross-speaker Emotion Transfer by Manipulating Speech Style Latents},
  author = {Suhee Jo and Younggun Lee and Yookyung Shin and Yeongtae Hwang and Taesu Kim},
  journal= {arXiv preprint arXiv:2303.08329},
  year   = {2023}
}

备注

accepted to ICASSP 2023