中文

RSET:基于重映射排序的情感转换语音合成方法

声音 2024-05-28 v1 音频与语音处理

摘要

虽然当前的文本转语音(Text-To-Speech, TTS)模型能够生成高质量的语音样本,但仍面临开发情感强度可控TTS模型的挑战。大多数现有TTS模型通过从参考语音中提取情感强度信息来实现情感强度控制。幸运的是,由于缺乏对类内情感强度建模和模型信息解耦能力,生成的语音无法实现细粒度的情感强度控制,且存在信息泄漏问题。本文提出一种情感转换TTS模型,定义基于重映射的排序方法来建模类内相对强度信息,结合相互信息(Mutual Information, MI)来解耦说话人和情感信息,合成具有可感知强度差异的表达语音。实验表明,我们的模型在保持说话人信息的同时,实现了细粒度的情感控制。

关键词

引用

@article{arxiv.2405.17028,
  title  = {RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis},
  author = {Haoxiang Shi and Jianzong Wang and Xulong Zhang and Ning Cheng and Jun Yu and Jing Xiao},
  journal= {arXiv preprint arXiv:2405.17028},
  year   = {2024}
}

备注

Accepted by the 8th APWeb-WAIM International Joint Conference on Web and Big Data