中文

基于注意力卷积神经网络的语音情感识别:输入特征、信号长度与表演语音的影响研究

计算与语言 2017-06-05 v1

摘要

语音情感识别是人机交互领域中一项重要且具有挑战性的任务。先前的工作提出了多种模型和特征集来训练系统。在本工作中,我们使用具有多视角学习目标函数的注意力卷积神经网络进行了大量实验。我们比较了使用不同输入信号长度、不同类型声学特征以及不同类型情感语音(即兴/脚本)时的系统性能。我们在交互式情感动作捕捉(IEMOCAP)数据库上的实验结果表明,识别性能强烈依赖于语音数据的类型,而与输入特征的选择无关。此外,我们在IEMOCAP的即兴语音数据上取得了当前最优结果。

关键词

引用

@article{arxiv.1706.00612,
  title  = {Attentive Convolutional Neural Network based Speech Emotion Recognition: A Study on the Impact of Input Features, Signal Length, and Acted Speech},
  author = {Michael Neumann and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:1706.00612},
  year   = {2017}
}

备注

to appear in the proceedings of Interspeech 2017