中文

基于异构图上下文建模的对话语音合成情感渲染

计算与语言 2023-12-20 v1 声音 音频与语音处理

摘要

对话语音合成(CSS)旨在对话场景中以恰当的韵律和情感语调准确表达话语。尽管CSS任务具有重要意义,但由于情感对话数据集的稀缺以及有状态情感建模的困难,先前的研究尚未深入探讨情感表现力问题。在本文中,我们提出了一种新颖的情感CSS模型,称为ECSS,它包含两个主要组件:1)为了增强情感理解,我们引入了一种基于异构图的上下文情感建模机制,该机制以多源对话历史作为输入来建模对话上下文并从上下文中学习情感线索;2)为了实现情感渲染,我们采用了一个基于对比学习的情感渲染器模块,以推断目标话语的准确情感风格。为了解决数据稀缺问题,我们精心创建了按类别和强度划分的情感标签,并在现有的对话数据集(DailyTalk)上标注了额外的情感信息。客观和主观评估均表明,我们的模型在理解和渲染情感方面优于基线模型。这些评估还凸显了全面情感标注的重要性。代码和音频样本可在以下网址找到:https://github.com/walker-hyf/ECSS。

关键词

引用

@article{arxiv.2312.11947,
  title  = {Emotion Rendering for Conversational Speech Synthesis with Heterogeneous Graph-Based Context Modeling},
  author = {Rui Liu and Yifan Hu and Yi Ren and Xiang Yin and Haizhou Li},
  journal= {arXiv preprint arXiv:2312.11947},
  year   = {2023}
}

备注

9 pages, 4 figures, Accepted by AAAI'2024, Code and audio samples: https://github.com/walker-hyf/ECSS