中文

基于孪生网络对比损失的语音情感识别

计算机视觉与模式识别 2019-10-25 v1 机器学习 音频与语音处理

摘要

语音情感识别是人机交互的重要方面。先前工作提出了多种端到端模型以提升分类性能。然而,其中大多数依赖于交叉熵损失与 softmax 作为监督组件,并未显式促进特征的可判别学习。本文中,我们引入对比损失函数以鼓励可学习特征的类内紧致性与类间可分性。此外,评估了多种特征选择方法与成对样本选择方法。为验证所提系统的性能,我们在常用评测语料库 The Interactive Emotional Dyadic Motion Capture (IEMOCAP) 数据库上进行了实验。实验结果揭示了所提方法的优势,其加权准确率达 62.19%,非加权准确率达 63.21%。相较未使用对比损失函数优化的基线系统,其加权准确率与非加权准确率分别高出 1.14% 与 2.55%。

关键词

引用

@article{arxiv.1910.11174,
  title  = {Speech Emotion Recognition via Contrastive Loss under Siamese Networks},
  author = {Zheng Lian and Ya Li and Jianhua Tao and Jian Huang},
  journal= {arXiv preprint arXiv:1910.11174},
  year   = {2019}
}

备注

ASMMC-MMAC 2018 Proceedings of the Joint Workshop of the 4th Workshop on Affective Social Multimedia Computing and first Multi-Modal Affective Computing of Large-Scale Multimedia Data