基于注意力时频神经网络的语音情感识别
声音
2022-10-25 v1 机器学习
多媒体
音频与语音处理
摘要
谱图通常用作深度神经网络的输入特征,以学习语音信号用于语音情感识别(SER)的较高层级时频模式。一般而言,不同情感在谱图上对应于频带内和时帧上的特定能量激活,这表明频域和时域对于表示SER的情感均至关重要。然而,近期基于谱图的工作主要聚焦于建模时域中的长程依赖,导致这些方法遇到以下两个问题:(1)在时频联合学习中忽略建模频域内与情感相关的相关性;(2)忽略捕获与情感相关的特定频带。为应对这些问题,我们提出一种用于SER的注意力时频神经网络(ATFNN),包括时频神经网络(TFNN)和时频注意力。具体而言,针对第一个问题,我们设计了一个TFNN,其包含基于Transformer编码器的频域编码器(F-Encoder)和基于双向长短期记忆(Bi-LSTM)的时域编码器(T-Encoder)。F-Encoder和T-Encoder分别建模频带内和时帧内的相关性,并被嵌入时频联合学习策略中以获取语音情感的时频模式。此外,为处理第二个问题,我们还采用具有频域注意力网络(F-Attention)和时域注意力网络(T-Attention)的时频注意力,以聚焦于与情感相关的频带范围和时帧范围,从而增强语音情感特征的判别性。
引用
@article{arxiv.2210.12430,
title = {Speech Emotion Recognition via an Attentive Time-Frequency Neural Network},
author = {Cheng Lu and Wenming Zheng and Hailun Lian and Yuan Zong and Chuangao Tang and Sunan Li and Yan Zhao},
journal= {arXiv preprint arXiv:2210.12430},
year = {2022}
}
备注
This paper has been accepted as a regular paper on IEEE Transactions on Computational Social Systems