中文

从图谱视角再探对话中的多模态情感识别

计算与语言 2024-05-06 v2

摘要

在多模态对话上下文中高效捕获一致性和互补性语义特征对于对话中的多模态情感识别(MERC)至关重要。现有方法主要使用图结构来建模对话上下文语义依赖关系,并采用图神经网络(GNN)捕获多模态语义特征进行情感识别。然而,这些方法受到GNN某些固有特性(如过平滑和低通滤波)的限制,导致无法高效学习长距离一致性信息和互补性信息。由于一致性和互补性信息分别对应低频和高频信息,本文从图谱的视角重新审视了对话中的多模态情感识别问题。具体而言,我们提出了一种基于图谱的多模态一致性与互补性协同学习框架GS-MCC。首先,GS-MCC使用滑动窗口构建多模态交互图以建模对话关系,并使用高效的傅里叶图算子分别提取长距离高频和低频信息。然后,GS-MCC使用对比学习构建反映互补性和一致性语义协作的自监督信号,并与高、低频信号协同,从而提升高、低频信息反映真实情感的能力。最后,GS-MCC将协同后的高、低频信息输入MLP网络和softmax函数进行情感预测。大量实验证明了本文提出的GS-MCC架构在两个基准数据集上的优越性。

关键词

引用

@article{arxiv.2404.17862,
  title  = {Revisiting Multimodal Emotion Recognition in Conversation from the Perspective of Graph Spectrum},
  author = {Tao Meng and Fuchen Zhang and Yuntao Shou and Wei Ai and Nan Yin and Keqin Li},
  journal= {arXiv preprint arXiv:2404.17862},
  year   = {2024}
}

备注

10 pages, 4 figures