Daisy-TTS:通过韵律嵌入分解模拟更广泛的情感谱系
计算与语言
2024-06-28 v2 声音
音频与语音处理
摘要
我们通常以多面化的方式口头表达情感,它们的强度可能各不相同,并且可能不是作为单一情感而是作为混合情感来表达。这种广泛的情感谱系在情感结构模型中得到了充分研究,该模型将各种情感表示为具有不同强度等级的主要情感的衍生产物。在本文中,我们提出了一种基于结构模型的情感文本转语音设计,以模拟更广泛的情感谱系。我们提出的设计 Daisy-TTS Incorporates 一个韵律编码器,用于学习情感可分离的韵律嵌入作为情感的代理。这种情感表示允许模型模拟:(1) 从训练样本中学习到的主要情感,(2) 作为主要情感混合的次要情感,(3) 通过缩放情感嵌入实现的强度等级,以及 (4) 通过否定情感嵌入实现的情感极性。通过一系列感知评估,Daisy-TTS 显示出比基线更高的整体情感语音自然度和情感可感知度。
引用
@article{arxiv.2402.14523,
title = {Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition},
author = {Rendi Chevi and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2402.14523},
year = {2024}
}
备注
Project Page: https://rendchevi.github.io/daisy-tts; Updates: (1) Fixed typos, missing references, and layout, (2) Revise explanation on emotion classifier or discriminator