中文

基于数据增强的CNN+LSTM语音情感识别架构

声音 2018-09-13 v2 计算与语言 机器学习 音频与语音处理

摘要

在这项工作中,我们使用IEMOCAP数据集设计了一个用于识别语音中情感的神经网络。遵循音频分析的最新进展,我们采用了一种包含卷积层和循环层的架构,前者用于从原始声谱图中提取高层特征,后者用于聚合长期依赖关系。我们考察了语音声道长度扰动的数据增强技术、逐层优化器调整、循环层的批量归一化,并在四种情感上获得了极具竞争力的结果:加权准确率64.5%,非加权准确率61.7%。

关键词

引用

@article{arxiv.1802.05630,
  title  = {CNN+LSTM Architecture for Speech Emotion Recognition with Data Augmentation},
  author = {Caroline Etienne and Guillaume Fidanza and Andrei Petrovskii and Laurence Devillers and Benoit Schmauch},
  journal= {arXiv preprint arXiv:1802.05630},
  year   = {2018}
}

备注

5 pages, 3 figures