中文

FSER:用于语音情感识别的深度卷积神经网络

音频与语音处理 2021-09-17 v1 计算机视觉与模式识别 人机交互

摘要

利用梅尔谱图替代传统的 MFCC 特征,我们评估了卷积神经网络从语音数据中准确识别与分类情感的能力。我们提出 FSER,一种在四个有效语音数据库上训练的语音情感识别模型,在愤怒、焦虑、平静、厌恶、高兴、中性、悲伤、惊讶这 8 种不同情感类别上取得了 95.05% 的高分类准确率。在每个基准数据集上,FSER 均优于迄今提出的最佳模型,达到了当前最优(state-of-the-art)性能。我们表明 FSER 具有可靠性,不受语言、性别身份及任何其他外部因素的影响。此外,我们描述了 FSER 如何可能被用于改善心理与情感健康护理,以及我们的分析与发现如何作为进一步相关工作的指南与基准。

关键词

引用

@article{arxiv.2109.07916,
  title  = {FSER: Deep Convolutional Neural Networks for Speech Emotion Recognition},
  author = {Bonaventure F. P. Dossou and Yeno K. S. Gbenou},
  journal= {arXiv preprint arXiv:2109.07916},
  year   = {2021}
}

备注

ABAW Workshop, ICCV 2021