中文

GraphCFC:一种基于有向图的跨模态特征互补多模态对话情感识别方法

计算与语言 2023-11-23 v4 机器学习 多媒体

摘要

对话中的情感识别(ERC)在人机交互(HCI)系统中起着重要作用,因为它可以提供共情服务。多模态 ERC 可以缓解单模态方法的缺点。近年来,图神经网络(GNNs)因其在关系建模中的优越性能而被广泛应用于各个领域。在多模态 ERC 中,GNNs 能够提取长距离上下文信息和模态间交互信息。遗憾的是,由于 MMGCN 等现有方法直接融合多种模态,可能会产生冗余信息并丢失多样化信息。在这项工作中,我们提出了一种基于有向图的跨模态特征互补(GraphCFC)模块,能够有效建模上下文和交互信息。GraphCFC 通过利用多个子空间提取器和成对跨模态互补(PairCC)策略,缓解了多模态融合中的异质性鸿沟问题。我们从构建的图中提取各类边用于编码,从而使 GNNs 在执行消息传递时能更准确地提取关键的上下文和交互信息。此外,我们设计了一种称为 GAT-MLP 的 GNN 结构,可为多模态学习提供新的统一网络框架。在两个基准数据集上的实验结果表明,我们的 GraphCFC 优于最先进的(SOTA)方法。

关键词

引用

@article{arxiv.2207.12261,
  title  = {GraphCFC: A Directed Graph Based Cross-Modal Feature Complementation Approach for Multimodal Conversational Emotion Recognition},
  author = {Jiang Li and Xiaoping Wang and Guoqing Lv and Zhigang Zeng},
  journal= {arXiv preprint arXiv:2207.12261},
  year   = {2023}
}

备注

Accepted by IEEE Transactions on Multimedia (TMM)