基于图神经网络的语音情感识别表示学习
声音
2022-08-23 v1 机器学习
音频与语音处理
摘要
学习具表达力的表示在深度学习中至关重要。在语音情感识别(SER)中,语音中的空白段或噪声会干扰表达性表示学习。然而,传统的基于 RNN 的模型易受此类噪声影响。近来,图神经网络(GNN)已展现其在表示学习上的有效性,我们采用该框架用于 SER。具体地,我们提出一种基于余弦相似度的图,作为 SER 中表示学习的理想图结构。我们提出一种基于余弦相似度的图卷积网络(CoGCN),其对扰动与噪声具有鲁棒性。实验结果表明,我们的方法优于当前最优方法,或以仅 1/30 参数量实现模型规模显著缩减下的具竞争力结果。
引用
@article{arxiv.2208.09830,
title = {Representation Learning with Graph Neural Networks for Speech Emotion Recognition},
author = {Junghun Kim and Jihie Kim},
journal= {arXiv preprint arXiv:2208.09830},
year = {2022}
}
备注
AAAI 2022 Workshop on Graphs and More Complex Structures for Learning and Reasoning (GCLR)