基于稀疏图学习与递归对齐的多模态情感识别
机器学习
2024-07-25 v1 人工智能
摘要
由于多模态情感识别在会话中的应用(如公共舆情监测、智能对话机器人等)受到广泛关注,近年来受到关注。不同于传统单模态情感识别,MERC 可融合多个模态(如文本、音频和视觉)的互补语义信息以提升情感识别效果。然而, prior work 忽略了多模态融合前的跨模态对齐过程及单模态内噪声处理,直接融合多模态特征,可能阻碍模型的表征学习。本研究提出一种新方法:Masked Graph Learning with Recursive Alignment(MGLRA),其使用具有记忆功能的递归迭代模块对多模态特征进行对齐,然后通过掩码 GCN 实现多模态特征融合。首先,我们采用 LSTM 捕获上下文信息,并利用图注意力过滤机制有效消除单模态内噪声。其次,构建带记忆功能的递归迭代模块,利用不同模态间的交互消除跨模态差距,实现模态间特征的初步对齐。随后引入跨模态多头注意力机制实现模态间特征对齐,并构建掩码 GCN 进行多模态特征融合,通过对图中节点进行随机掩码重建获取更佳的节点特征表征。最后,我们使用多层感知机(MLP)完成情感识别。在 IEMOCAP 和 MELD 两个基准数据集上的大量实验表明,{MGLRA} 优于当前流方法。
引用
@article{arxiv.2407.16714,
title = {Masked Graph Learning with Recurrent Alignment for Multimodal Emotion Recognition in Conversation},
author = {Tao Meng and Fuchen Zhang and Yuntao Shou and Hongen Shao and Wei Ai and Keqin Li},
journal= {arXiv preprint arXiv:2407.16714},
year = {2024}
}
备注
15 pages, 9 figures