基于模内与模间图对比学习对抗表示的多模态情感识别
计算与语言
2024-09-04 v2
摘要
随着社交媒体平台上开源情感识别数据集的不断增多以及计算资源的快速发展,多模态情感识别任务(MER)开始受到广泛的研究关注。MER任务从不同模态中提取并融合互补的语义信息,从而对说话者的情感进行分类。然而,现有的特征融合方法通常将不同模态的特征映射到同一特征空间进行信息融合,这无法消除不同模态之间的异构性。因此,后续的情感类别边界学习面临挑战。为了解决上述问题,我们提出了一种新颖的基于模内与模间图对比对抗表示的多模态情感识别(AR-IIGCN)方法。首先,我们将视频、音频和文本特征输入到多层感知机(MLP)中,将其映射到独立的特征空间。其次,我们通过对抗表示为三种模态特征构建生成器和判别器,实现模态间的信息交互并消除模态间的异构性。第三,我们引入对比图表示学习,以捕获模内和模间互补的语义信息,并学习情感类别的类内与类间边界信息。具体而言,我们为三种模态特征构建图结构,并对同一模态中具有不同情感的节点以及不同模态中具有相同情感的节点进行对比表示学习,从而提高节点的特征表示能力。大量实验表明,ARL-IIGCN方法能够在IEMOCAP和MELD数据集上显著提高情感识别准确率。
引用
@article{arxiv.2312.16778,
title = {Adversarial Representation with Intra-Modal and Inter-Modal Graph Contrastive Learning for Multimodal Emotion Recognition},
author = {Yuntao Shou and Tao Meng and Wei Ai and Nan Yin and Keqin Li},
journal= {arXiv preprint arXiv:2312.16778},
year = {2024}
}
备注
14 pages, 6 figures