中文

从不平衡语音数据中学习情感表征用于语音情感识别与情感文本到语音合成

音频与语音处理 2023-06-12 v1 计算与语言 声音

摘要

有效的语音情感表征在语音情感识别(SER)和情感文本到语音(TTS)任务中起着关键作用。然而,相较于中性风格语音,情感语音样本的获取更为困难且昂贵,这导致了一个大多数相关工作不幸忽视的问题:数据集不平衡。模型可能过拟合于占多数的中性类别,而无法产生鲁棒且有效的情感表征。本文中,我们提出一种情感提取器来解决该问题。我们使用增强方法来训练模型,使其能从不平衡数据集中提取有效且可泛化的情感表征。我们的经验结果表明:(1)对于 SER 任务,所提情感提取器在三个不平衡数据集上超越了最先进的基线;(2)我们的情感提取器所产生的表征有益于 TTS 模型,并使其能合成更具表现力的语音。

关键词

引用

@article{arxiv.2306.05709,
  title  = {Learning Emotional Representations from Imbalanced Speech Data for Speech Emotion Recognition and Emotional Text-to-Speech},
  author = {Shijun Wang and Jón Guðnason and Damian Borth},
  journal= {arXiv preprint arXiv:2306.05709},
  year   = {2023}
}

备注

Accepted by INTERSPEECH2023