中文

利用 3D CNN 学习谱时特征以用于语音情感识别

计算与语言 2017-08-18 v1 计算机视觉与模式识别

摘要

在本文中,我们提出使用深度三维卷积网络(3D CNNs)来解决语音情感识别(SER)中谱时动态建模的挑战。与卷积神经网络和长短期记忆网络的混合架构(CNN-LSTM)相比,我们提出的 3D CNNs 能够以适中的参数量同时提取短期和长期谱特征。我们使用聚合语料库以说话人无关的方式评估了我们提出的方法及其他最先进的方法,这些语料库提供了大量且多样化的说话人集合。我们发现:1)同质架构的浅层时间核和中等深度谱核对于该任务是最优的;2)与其他方法相比,我们的 3D CNNs 在谱时特征学习方面更为有效。最后,我们使用 t-分布随机邻域嵌入(T-SNE)可视化了我们提出方法获得的特征空间,并能够观察到明显的情感聚类。

关键词

引用

@article{arxiv.1708.05071,
  title  = {Learning spectro-temporal features with 3D CNNs for speech emotion recognition},
  author = {Jaebok Kim and Khiet P. Truong and Gwenn Englebienne and Vanessa Evers},
  journal= {arXiv preprint arXiv:1708.05071},
  year   = {2017}
}

备注

ACII, 2017, San Antonio