EmoDiff:基于软标签引导的强度可控情感语音合成
音频与语音处理
2023-02-17 v2 人工智能
人机交互
机器学习
声音
摘要
尽管当前的神经文本转语音(TTS)模型能够生成高质量语音,强度可控的情感TTS仍是一项具有挑战性的任务。大多数现有方法需要外部优化来计算强度,导致次优结果或质量下降。本文提出EmoDiff,一种基于扩散的TTS模型,其中情感强度可通过所提出的源自分类器引导的软标签引导技术进行操控。具体而言,EmoDiff不是由指定情感的一热向量引导,而是由软标签引导,其中指定情感和\textit{中性(Neutral)}的值分别设为 和 。此处 表示情感强度,可取0到1之间的值。我们的实验表明,EmoDiff能在保持高语音质量的同时精确控制情感强度。此外,通过在反向去噪过程中采样,可生成具有指定情感强度的多样化语音。
引用
@article{arxiv.2211.09496,
title = {EmoDiff: Intensity Controllable Emotional Text-to-Speech with Soft-Label Guidance},
author = {Yiwei Guo and Chenpeng Du and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2211.09496},
year = {2023}
}
备注
Accepted to ICASSP2023