面向对话中多模态情感识别的动态融合感知图卷积神经网络
人工智能
2026-03-25 v1
摘要
多模态情感识别在对话中(MERC)旨在从说话者在言语互动中表达的多种模态(如文本、音频、图像等)中识别和理解情感。已有研究表明,图卷积神经网络(GCN)可通过建模说话者之间的依赖关系来提高MERC性能。然而,现有方法通常使用固定参数处理不同情感类型的多模态特征,忽视了不同模态之间融合的动态特性,这迫使模型在多个情感类别之间进行性能平衡,从而限制了模型在某些特定情感类别上的表现。为此,我们提出一种动态融合感知图卷积神经网络(DF-GCN),用于对话中多模态情感特征的稳健识别。具体而言,DF-GCN将常微分方程引入图卷积网络,以{捕捉}对话互动网络中情感依赖的动态特性,并利用说话特征的全局信息向量(Global Information Vector,GIV)生成的提示来引导多模态特征的动态融合。这使得我们的模型在处理每个说话特征时能够动态调整参数,从而为推理阶段的不同情感类别配备不同的网络参数,实现更灵活的情感分类,提高模型的泛化能力。对两个公开的多模态对话数据集上的全面实验确认,所提出的DF-GCN模型性能卓越,显著受益于引入的动态融合机制。
引用
@article{arxiv.2603.22345,
title = {Dynamic Fusion-Aware Graph Convolutional Neural Network for Multimodal Emotion Recognition in Conversations},
author = {Tao Meng and Weilun Tang and Yuntao Shou and Yilong Tan and Jun Zhou and Wei Ai and Keqin Li},
journal= {arXiv preprint arXiv:2603.22345},
year = {2026}
}
备注
16 pages