中文

用于语音情感识别的紧凑图架构

计算机视觉与模式识别 2021-02-03 v4 机器学习 音频与语音处理

摘要

我们提出一种深度图方法来解决语音情感识别任务。以图的形式表示数据是一种紧凑、高效且可扩展的方式。遵循图信号处理理论,我们提出将语音信号建模为循环图或线图。这种图结构使我们能够构建基于图卷积网络(GCN)的架构,该架构可执行精确的图卷积,而标准GCN中使用的是近似卷积。我们在流行的IEMOCAP和MSP-IMPROV数据库上评估了我们的模型在语音情感识别上的性能。我们的模型优于标准GCN和其他相关的深度图架构,表明了该方法的有效性。与现有语音情感识别方法相比,我们的模型以显著更少的可学习参数(约30K)达到了与最先进(SOTA)方法相当的性能,表明其在资源受限设备中的适用性。

关键词

引用

@article{arxiv.2008.02063,
  title  = {Compact Graph Architecture for Speech Emotion Recognition},
  author = {A. Shirian and T. Guha},
  journal= {arXiv preprint arXiv:2008.02063},
  year   = {2021}
}