一种用于语音情感识别的带数据增强的集成1D-CNN-LSTM-GRU模型
声音
2022-11-23 v2 音频与语音处理
摘要
本文中,我们提出一种由有效语音特征学习得到的深度神经网络集成及数据增强(DA)方法,用于从语音中识别情感。我们的集成模型构建于三个基于深度神经网络的模型之上。这些神经网络使用基本局部特征获取块(LFAB)构建,LFAB是连续的一维膨胀卷积神经网络层,其后接最大池化与批归一化层。为获取语音信号中的长期依赖,进一步提出两种变体,分别添加门控循环单元(GRU)和长短期记忆(LSTM)层。所有三个网络模型在最终softmax分类层之前都有连续的 fully connected 层。集成模型使用加权平均提供最终分类。我们利用五个标准基准数据集:TESS、EMO-DB、RAVDESS、SAVEE和CREMA-D进行评估。我们通过注入加性白高斯噪声、音高偏移和拉伸信号电平来进行DA,以使模型泛化,从而提高模型准确率并减少过拟合。我们从每个音频样本手工提取了五类特征:梅尔频率倒谱系数、对数梅尔尺度谱图、过零率、色度图和统计均方根能量值。这些特征作为LFAB块的输入,进一步提取隐藏局部特征,然后根据模型类型馈入全连接层或LSTM或GRU以获取额外的长期上下文表示。LFAB后接GRU或LSTM相比基线模型取得更好性能。集成模型在所有数据集上达到了最先进的加权平均准确率。
引用
@article{arxiv.2112.05666,
title = {An Ensemble 1D-CNN-LSTM-GRU Model with Data Augmentation for Speech Emotion Recognition},
author = {Md. Rayhan Ahmed and Salekul Islam and Ph. D and A. K. M. Muzahidul Islam and Ph. D and Swakkhar Shatabda and Ph. D},
journal= {arXiv preprint arXiv:2112.05666},
year = {2022}
}
备注
This paper is currently under revision process at expert systems with applications journal