中文

增强生成对抗网络用于语音情感识别

声音 2020-07-28 v3 音频与语音处理

摘要

生成对抗网络(GANs)在情感属性学习和新数据样本生成方面已显示出潜力。然而,其性能通常受到较大规模语音情感识别(SER)数据不可用的制约。在这项工作中,我们提出一个利用mixup数据增强方案来增强GAN在特征学习和生成方面的框架。为展示所提框架的有效性,我们给出了在以下方面的SER结果:(i)合成特征向量,(ii)用合成特征扩充训练数据,(iii)压缩表示中的编码特征。我们的结果表明,所提框架能够有效学习压缩的情感表示,并且能生成有助于提升语料内和跨语料评估性能的合成样本。

关键词

引用

@article{arxiv.2005.08447,
  title  = {Augmenting Generative Adversarial Networks for Speech Emotion Recognition},
  author = {Siddique Latif and Muhammad Asim and Rajib Rana and Sara Khalifa and Raja Jurdak and Björn W. Schuller},
  journal= {arXiv preprint arXiv:2005.08447},
  year   = {2020}
}

备注

Accepted in INTERSPEECH 2020