中文

MS-SENet:通过结合 Squeeze-and-Excitation 模块的多尺度特征融合增强语音情感识别

声音 2023-12-29 v2 人机交互 音频与语音处理

摘要

语音情感识别(SER)已成为人机交互研究中日益关注的焦点。时空特征在 SER 中起着至关重要的作用,然而当前研究缺乏对时空特征的全面学习。本文旨在通过提出一种新方法来填补这一空白。在本文中,我们采用具有不同卷积核大小的卷积神经网络(CNN)进行空间和时间特征提取。此外,我们引入 Squeeze-and-Excitation(SE)模块来捕捉并融合多尺度特征,促进有效的信息融合以改进情感识别,并深入理解语音情感的时间演变。此外,我们采用跳跃连接和空间 Dropout(SD)层来防止过拟合并增加模型深度。我们的方法优于先前的 SOTA 方法,在六个基准 SER 数据集上分别实现了 1.62% 和 1.32% 的平均 UAR 和 WAR 提升。进一步的实验表明,我们的方法能够在低资源条件下充分提取时空特征。

关键词

引用

@article{arxiv.2312.11974,
  title  = {Ms-senet: Enhancing Speech Emotion Recognition Through Multi-scale Feature Fusion With Squeeze-and-excitation Blocks},
  author = {Mengbo Li and Yuanzhong Zheng and Dichucheng Li and Yulun Wu and Yaoxuan Wang and Haojun Fei},
  journal= {arXiv preprint arXiv:2312.11974},
  year   = {2023}
}