中文

基于CNN-Transformer与多维注意力机制的语音情感识别

音频与语音处理 2024-06-05 v2

摘要

语音情感识别(SER)在人机交互中至关重要。主流方法利用卷积神经网络或循环神经网络从语音信息中学习语音片段的局部能量特征表示,但在捕获诸如语音中能量持续时间等全局信息方面存在困难。一些方法使用Transformer来捕获全局信息,但在参数量和性能方面仍有改进空间。此外,现有的注意力机制侧重于空间或通道维度,阻碍了对语音中重要时间信息的学习。在本文中,为了在不同粒度级别上建模语音中的局部和全局信息,并捕获语音信号中的时间、空间和通道依赖关系,我们提出了一种基于CNN-Transformer和多维注意力机制的语音情感识别网络。具体而言,一叠CNN块致力于从时频角度捕获语音中的局部信息。此外,使用时间-通道-空间注意力机制在三个维度上增强特征。而且,我们使用具有深度可分离卷积的大卷积核和轻量级Transformer模块来建模特征序列的局部和全局依赖关系。我们在IEMOCAP和Emo-DB数据集上评估了所提出的方法,并表明我们的方法显著优于现有方法(SOTA)。

关键词

引用

@article{arxiv.2403.04743,
  title  = {Speech Emotion Recognition Via CNN-Transformer and Multidimensional Attention Mechanism},
  author = {Xiaoyu Tang and Yixin Lin and Ting Dang and Yuanfang Zhang and Jintao Cheng},
  journal= {arXiv preprint arXiv:2403.04743},
  year   = {2024}
}