中文

利用中心损失与重构作为正则化器学习判别性特征用于语音情感识别

声音 2019-09-04 v2 机器学习 音频与语音处理 机器学习

摘要

本文提出一种受多任务学习(MTL)启发、基于语音特征并在 softmax 损失与中心损失(一种强大的度量学习策略)联合监督下训练的卷积神经网络(CNN),用于语音情感识别。频谱图与梅尔频率倒谱系数(MFCC)等语音特征有助于保留语音中与情感相关的底层特性。我们尝试了多种以语音特征为输入并在 softmax 与中心损失下训练的深层神经网络(DNN)架构,由此得到极适合语音情感识别(SER)的高判别性特征。我们的网络还通过同时执行重构输入语音特征的辅助任务而产生正则化效应。这种在相关任务间共享表征的方式使我们的网络能更好地泛化 SER 这一原始任务。我们所提出的若干网络相比最先进架构参数量大幅减少。

关键词

引用

@article{arxiv.1906.08873,
  title  = {Learning Discriminative features using Center Loss and Reconstruction as Regularizer for Speech Emotion Recognition},
  author = {Suraj Tripathi and Abhiram Ramesh and Abhay Kumar and Chirag Singh and Promod Yenigalla},
  journal= {arXiv preprint arXiv:1906.08873},
  year   = {2019}
}

备注

10 pages, Accepted in IJCAI Affective Computing Workshop 2019