增强生成对抗网络用于语音情感识别
声音
2020-07-28 v3 音频与语音处理
摘要
生成对抗网络(GANs)在情感属性学习和新数据样本生成方面已显示出潜力。然而,其性能通常受到较大规模语音情感识别(SER)数据不可用的制约。在这项工作中,我们提出一个利用mixup数据增强方案来增强GAN在特征学习和生成方面的框架。为展示所提框架的有效性,我们给出了在以下方面的SER结果:(i)合成特征向量,(ii)用合成特征扩充训练数据,(iii)压缩表示中的编码特征。我们的结果表明,所提框架能够有效学习压缩的情感表示,并且能生成有助于提升语料内和跨语料评估性能的合成样本。
引用
@article{arxiv.2005.08447,
title = {Augmenting Generative Adversarial Networks for Speech Emotion Recognition},
author = {Siddique Latif and Muhammad Asim and Rajib Rana and Sara Khalifa and Raja Jurdak and Björn W. Schuller},
journal= {arXiv preprint arXiv:2005.08447},
year = {2020}
}
备注
Accepted in INTERSPEECH 2020