基于Mamba增强的文本-音频-视频对齐网络用于对话情感识别
计算机视觉与模式识别
2024-09-10 v1
摘要
对话情感识别(ERC)是多模态交互研究中的一个关键领域,致力于准确识别和分类对话中说话者表达的情感。传统的ERC方法主要依赖单模态线索(如文本、音频或视觉数据),导致其有效性受限。这些方法面临两个重大挑战:1) 多模态信息的一致性。在整合不同模态之前,确保来自不同来源的数据对齐且连贯至关重要。2) 上下文信息捕获。成功融合多模态特征需要敏锐理解不断变化的情感基调,尤其是在情感可能随时间演变的长篇对话中。为解决这些局限,我们提出了一种新颖的基于Mamba增强的文本-音频-视频对齐网络(MaTAV)用于ERC任务。MaTAV具有对齐单模态特征以确保跨模态一致性,以及处理长输入序列以更好捕获上下文多模态信息的优势。在MELD和IEMOCAP数据集上的大量实验表明,MaTAV在ERC任务上以较大优势显著优于现有最先进方法。
引用
@article{arxiv.2409.05243,
title = {Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations},
author = {Xinran Li and Xiaomao Fan and Qingyang Wu and Xiaojiang Peng and Ye Li},
journal= {arXiv preprint arXiv:2409.05243},
year = {2024}
}