中文

一种带加权多重聚合器的图同构网络用于语音情感识别

音频与语音处理 2022-11-02 v1 人工智能 声音

摘要

语音情感识别(SER)是人机交互的重要组成部分。本文提出一种基于带加权多重聚合器的图同构网络(WMA-GIN)的SER网络,该网络能有效处理GIN结构中邻居节点特征聚合在一起时的信息混淆问题。此外,采用全邻接(FA)层来缓解包括GIN在内的所有图神经网络(GNN)结构中存在的过压缩(over-squashing)问题。进一步,采用多阶段注意力机制和多损失训练策略,以避免在堆叠的WMA-GIN层中丢失有用的情感信息。我们在流行的IEMOCAP数据集上评估了所提WMA-GIN的性能。实验结果表明,WMA-GIN优于其他基于GNN的方法,并取得了72.48%的加权准确率(WA)和67.72%的非加权准确率(UA),与一些先进的非图基方法相当。

关键词

引用

@article{arxiv.2207.00940,
  title  = {A Graph Isomorphism Network with Weighted Multiple Aggregators for Speech Emotion Recognition},
  author = {Ying Hu and Yuwu Tang and Hao Huang and Liang He},
  journal= {arXiv preprint arXiv:2207.00940},
  year   = {2022}
}

备注

Accepted by Interspeech 2022