时序建模至关重要:一种用于语音情感识别的新型时序情感建模方法
声音
2023-10-03 v3 计算与语言
音频与语音处理
摘要
语音情感识别(SER)通过从语音信号中推断人类情感与情绪状态,在改善人机交互方面发挥着重要作用。尽管近期工作主要关注从手工特征中挖掘时空信息,我们探索了如何从动态时间尺度对语音情感的时序模式进行建模。为此,我们提出了一种用于SER的新型时序情感建模方法,称为时序感知双向多尺度网络(TIM-Net),它从多种时间尺度中学习多尺度上下文情感表征。具体而言,TIM-Net首先使用时序感知模块学习时序情感表征,然后整合来自过去与未来的互补信息以丰富上下文表征,最后融合多时间尺度特征以更好地适应情感变化。在六个基准SER数据集上的大量实验结果表明了TIM-Net的优越性能,其在每个语料库上相较第二名分别平均提升了2.34%的UAR和2.61%的WAR。源代码可在 https://github.com/Jiaxin-Ye/TIM-Net_SER 获取。
引用
@article{arxiv.2211.08233,
title = {Temporal Modeling Matters: A Novel Temporal Emotional Modeling Approach for Speech Emotion Recognition},
author = {Jiaxin Ye and Xin-cheng Wen and Yujie Wei and Yong Xu and Kunhong Liu and Hongming Shan},
journal= {arXiv preprint arXiv:2211.08233},
year = {2023}
}
备注
ICASSP 2023