中文

基于多尺度特征表示与全局感知融合的语音情感识别

声音 2022-04-13 v1 机器学习 音频与语音处理

摘要

语音情感识别(SER)是一项从语音数据预测情感标签的基础任务。近期工作多聚焦于使用卷积神经网络(CNNs)将时变谱特征视为图像,从而在固定尺度特征表示上学习局部注意力图。然而,由于现有 CNNs 在 SER 上的局限,不同尺度上丰富的情感特征与重要的全局信息无法被很好地捕获。在本文中,我们提出一种新颖的全局感知多尺度(GLAM)神经网络(代码见 https://github.com/lixiangucas01/GLAM),以通过全局感知融合模块学习多尺度特征表示并关注情感信息。具体而言,GLAM 迭代地利用多种不同尺度的卷积核来学习多种特征表示。随后,不同于基于注意力的方法,我们应用一个简单而有效的全局感知融合模块来全局抓取最重要的情感信息。在基准语料库 IEMOCAP 上针对四种情感的实验表明,与先前最先进的方法相比,我们所提模型在四个常用指标上取得了 2.5% 至 4.5% 的提升,具有优越性。

关键词

引用

@article{arxiv.2204.05571,
  title  = {Speech Emotion Recognition with Global-Aware Fusion on Multi-scale Feature Representation},
  author = {Wenjing Zhu and Xiang Li},
  journal= {arXiv preprint arXiv:2204.05571},
  year   = {2022}
}

备注

6 pages, 3 figures, ICASSP 2022