中文

基于中心损失从声谱图学习情感识别的判别特征

音频与语音处理 2025-01-03 v1 人工智能 声音

摘要

从语音中识别情绪状态对于机器与说话者的自然交互至关重要。然而,提取有效的情感识别特征困难,因为情绪是模糊的。我们提出了一种新方法,通过协同softmax交叉熵损失和中心损失共同学习从变长声谱图中提取情感识别的判别特征。softmax交叉熵损失使不同情绪类别的特征可分离,中心损失有效地将属于同一情绪类别的特征拉向其中心。通过将两种损失结合起来,将显著增强判别力,这导致网络学习更有效的情感识别特征。实验结果表明,引入中心损失后,Mel-声谱图输入下的 unweighted accuracy 和 weighted accuracy 均提高了超过3%,于短时傅里叶变换声谱图输入下则提高了超过4%。

关键词

引用

@article{arxiv.2501.01103,
  title  = {learning discriminative features from spectrograms using center loss for speech emotion recognition},
  author = {Dongyang Dai and Zhiyong Wu and Runnan Li and Xixin Wu and Jia Jia and Helen Meng},
  journal= {arXiv preprint arXiv:2501.01103},
  year   = {2025}
}

备注

Accepted at ICASSP 2019