基于MFCC和CNN-LSTM架构的语音情感检测
声音
2025-01-22 v1 机器学习
音频与语音处理
摘要
情感检测技术已主要应用于面部图像特征和声学音频特征,后者因语音音频处理的复杂性以及提取合适特征的困难而尚未得到广泛应用。本文选取部分SAVEE和RAVDESS数据集并组合作为数据集,包含七种常见情感(即快乐、中性、悲伤、愤怒、厌恶、恐惧和惊讶)以及数千个样本。基于Librosa软件包,本文将初始音频输入处理为波形图和频谱图进行分析,主要关注包括MFCC在内的多个特征作为特征提取目标。采用CNN-LSTM混合架构,由于其处理序列数据和时间序列的强大能力,该架构主要由四个卷积层和三个长短期记忆层组成。结果表明,该架构在测试集上总体达到了61.07%的准确率,其中愤怒和中性检测的性能分别为75.31%和71.70%。还可以得出,分类准确率在一定程度上取决于情感的属性,频繁使用且特征明确的情感不太可能被误分类为其他类别。诸如惊讶此类的情感意义取决于具体语境,更容易与积极或消极情感混淆,负面情感也可能相互混合。
引用
@article{arxiv.2501.10666,
title = {Speech Emotion Detection Based on MFCC and CNN-LSTM Architecture},
author = {Qianhe Ouyang},
journal= {arXiv preprint arXiv:2501.10666},
year = {2025}
}
备注
7 pages, 5 figures, Applied and Computational Engineering