中文

用于语音情感识别的生成式情感AI:合成情感语音增强的案例

声音 2023-01-11 v1 音频与语音处理

摘要

尽管深度学习取得了进展,当前的先进语音情感识别(SER)系统由于缺少语音情感数据集而性能仍然不佳。本文提出利用基于扩展Tacotron架构的端到端文本到语音(TTS)系统生成的合成情感语音来增强SER系统。所提TTS系统包含说话人与情感嵌入的编码器、用于生成梅尔谱图的序列到序列文本生成器,以及从梅尔谱图生成音频的WaveRNN。大量实验表明,所生成的情感语音质量能显著提升多个数据集上的SER性能,其相较基线更高的平均意见得分(MOS)证明了这一点。所生成的样本在增强SER性能方面同样有效。

关键词

引用

@article{arxiv.2301.03751,
  title  = {Generative Emotional AI for Speech Emotion Recognition: The Case for Synthetic Emotional Speech Augmentation},
  author = {Abdullah Shahid and Siddique Latif and Junaid Qadir},
  journal= {arXiv preprint arXiv:2301.03751},
  year   = {2023}
}

备注

Under review