中文

AffectEcho:用于语音合成说话人无关且语言无关的情感与情绪迁移

声音 2023-08-21 v1 计算与语言 人机交互 音频与语音处理

摘要

情感(affect)是一种涵盖效价、唤醒度和强度的情绪特征,是实现真实对话的关键属性。尽管现有的文本转语音(TTS)和语音到语音系统依赖强度嵌入向量和全局风格标记来捕捉情感,这些模型将情感作为风格的一个组成部分或以离散类别表示。我们提出AffectEcho,一种情感翻译模型,使用向量量化码本在量化空间中建模情感,该空间具有五个级别的情感强度,以捕捉同一情感中的复杂细微差别与微妙差异。量化情感嵌入从口语语音样本中隐式导出,无需独热向量或显式强度嵌入。实验结果表明,我们的方法在控制生成语音情感的同时,保留了各说话人特有的身份、风格和情感节奏。我们利用从双语(英语和中文)语音语料库学习的量化情感嵌入,通过从参考语音到目标语音的情感迁移任务,展示了其语言无关的情感建模能力。我们在定性与定量指标上均取得了最先进(state-of-art)的结果。

关键词

引用

@article{arxiv.2308.08577,
  title  = {AffectEcho: Speaker Independent and Language-Agnostic Emotion and Affect Transfer for Speech Synthesis},
  author = {Hrishikesh Viswanath and Aneesh Bhattacharya and Pascal Jutras-Dubé and Prerit Gupta and Mridu Prashanth and Yashvardhan Khaitan and Aniket Bera},
  journal= {arXiv preprint arXiv:2308.08577},
  year   = {2023}
}