FSER:用于语音情感识别的深度卷积神经网络
音频与语音处理
2021-09-17 v1 计算机视觉与模式识别
人机交互
摘要
利用梅尔谱图替代传统的 MFCC 特征,我们评估了卷积神经网络从语音数据中准确识别与分类情感的能力。我们提出 FSER,一种在四个有效语音数据库上训练的语音情感识别模型,在愤怒、焦虑、平静、厌恶、高兴、中性、悲伤、惊讶这 8 种不同情感类别上取得了 95.05% 的高分类准确率。在每个基准数据集上,FSER 均优于迄今提出的最佳模型,达到了当前最优(state-of-the-art)性能。我们表明 FSER 具有可靠性,不受语言、性别身份及任何其他外部因素的影响。此外,我们描述了 FSER 如何可能被用于改善心理与情感健康护理,以及我们的分析与发现如何作为进一步相关工作的指南与基准。
引用
@article{arxiv.2109.07916,
title = {FSER: Deep Convolutional Neural Networks for Speech Emotion Recognition},
author = {Bonaventure F. P. Dossou and Yeno K. S. Gbenou},
journal= {arXiv preprint arXiv:2109.07916},
year = {2021}
}
备注
ABAW Workshop, ICCV 2021