中文

基于图神经网络的语音情感识别表示学习

声音 2022-08-23 v1 机器学习 音频与语音处理

摘要

学习具表达力的表示在深度学习中至关重要。在语音情感识别(SER)中,语音中的空白段或噪声会干扰表达性表示学习。然而,传统的基于 RNN 的模型易受此类噪声影响。近来,图神经网络(GNN)已展现其在表示学习上的有效性,我们采用该框架用于 SER。具体地,我们提出一种基于余弦相似度的图,作为 SER 中表示学习的理想图结构。我们提出一种基于余弦相似度的图卷积网络(CoGCN),其对扰动与噪声具有鲁棒性。实验结果表明,我们的方法优于当前最优方法,或以仅 1/30 参数量实现模型规模显著缩减下的具竞争力结果。

关键词

引用

@article{arxiv.2208.09830,
  title  = {Representation Learning with Graph Neural Networks for Speech Emotion Recognition},
  author = {Junghun Kim and Jihie Kim},
  journal= {arXiv preprint arXiv:2208.09830},
  year   = {2022}
}

备注

AAAI 2022 Workshop on Graphs and More Complex Structures for Learning and Reasoning (GCLR)