中文

利用梅尔频谱图中的谐波与打击乐分量进行语音情感识别

声音 2023-12-19 v1 计算机视觉与模式识别 人机交互 机器学习 多媒体 音频与语音处理

摘要

语音情感识别(SER)情感技术使智能嵌入式设备能够进行敏感交互。同样,呼叫中心员工通过感知客户的音高、能量和语调来识别其情绪,从而调整自身语音以实现高质量的客户交互。本工作首次探索了梅尔频谱图中谐波与打击乐分量在 SER 中的效果。我们尝试通过分解可区分的声学特征来利用梅尔频谱图,并将其用于我们提出的架构中,该架构包含一种新颖的特征图生成算法、一个基于 CNN 的网络特征提取器和一个多层感知机(MLP)分类器。本研究特别关注有效的数据增强技术,以构建丰富的混合特征图。此过程最终生成一个函数,输出二维图像,从而可作为预训练 CNN-VGG16 特征提取器的输入数据。此外,我们还研究了其他声学特征,如 MFCC、色谱图、频谱对比度和 Tonnetz,以评估我们提出的框架。在 Berlin EMO-DB 数据库上取得了 92.79% 的测试准确率。我们的结果优于先前使用 CNN-VGG16 的工作。

关键词

引用

@article{arxiv.2312.10949,
  title  = {Leveraged Mel spectrograms using Harmonic and Percussive Components in Speech Emotion Recognition},
  author = {David Hason Rudd and Huan Huo and Guandong Xu},
  journal= {arXiv preprint arXiv:2312.10949},
  year   = {2023}
}

备注

12 pages