中文

基于语音的情感识别中的对抗自编码器

机器学习 2018-06-07 v1 机器学习

摘要

近来,生成对抗网络与对抗自编码器因在 digit 分类与人脸识别等任务中表现卓越而在机器学习界备受关注。它们将自编码器的瓶颈层输出(称为码向量)映射到不同的噪声概率分布函数(PDF),并可进一步基于类别信息正则化以实现聚类。此外,它们还允许通过从映射的 PDF 中采样码向量来生成合成样本。受这些特性启发,我们探究了对抗自编码器在情感识别领域的应用。具体而言,我们从以下两方面开展实验:(i) 其将情感语句的高维特征向量表示编码至压缩空间的能力(在压缩空间中情感类别可判别性损失最小),以及 (ii) 其在原始特征空间中再生合成样本的能力,以用于训练情感识别分类器等目的。我们在 Interactive Emotional Dyadic Motion Capture (IEMOCAP) 语料库上展示了对抗自编码器在这些方面的潜力并给出分析。

关键词

引用

@article{arxiv.1806.02146,
  title  = {Adversarial Auto-encoders for Speech Based Emotion Recognition},
  author = {Saurabh Sahu and Rahul Gupta and Ganesh Sivaraman and Wael AbdAlmageed and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:1806.02146},
  year   = {2018}
}

备注

5 pages, INTERSPEECH 2017 August 20-24, 2017, Stockholm, Sweden