中文

基于解耦表示的半监督连续情感强度可控语音合成

音频与语音处理 2023-05-30 v2 机器学习 声音

摘要

近期的文本到语音模型已能达到生成类似人类说话的自然语音的水平。但在表现力方面仍存在局限。现有情感语音合成模型已展示出利用情感潜空间中带缩放参数的插值特征实现可控性。然而,现有模型生成的情感潜空间因情感、说话人等特征的纠缠而难以控制连续情感强度。本文提出一种利用半监督学习控制连续情感强度的新方法。该模型使用从语音信息的音素级序列生成的伪标签学习中等等级强度情感。所提模型构建的嵌入空间满足具情感基的均匀网格几何。实验结果表明,所提方法在可控性和自然度上更优。

关键词

引用

@article{arxiv.2211.06160,
  title  = {Semi-supervised learning for continuous emotional intensity controllable speech synthesis with disentangled representations},
  author = {Yoori Oh and Juheon Lee and Yoseob Han and Kyogu Lee},
  journal= {arXiv preprint arXiv:2211.06160},
  year   = {2023}
}

备注

Accepted by Interspeech 2023