中文

基于Mamba增强的文本-音频-视频对齐网络用于对话情感识别

计算机视觉与模式识别 2024-09-10 v1

摘要

对话情感识别(ERC)是多模态交互研究中的一个关键领域,致力于准确识别和分类对话中说话者表达的情感。传统的ERC方法主要依赖单模态线索(如文本、音频或视觉数据),导致其有效性受限。这些方法面临两个重大挑战:1) 多模态信息的一致性。在整合不同模态之前,确保来自不同来源的数据对齐且连贯至关重要。2) 上下文信息捕获。成功融合多模态特征需要敏锐理解不断变化的情感基调,尤其是在情感可能随时间演变的长篇对话中。为解决这些局限,我们提出了一种新颖的基于Mamba增强的文本-音频-视频对齐网络(MaTAV)用于ERC任务。MaTAV具有对齐单模态特征以确保跨模态一致性,以及处理长输入序列以更好捕获上下文多模态信息的优势。在MELD和IEMOCAP数据集上的大量实验表明,MaTAV在ERC任务上以较大优势显著优于现有最先进方法。

关键词

引用

@article{arxiv.2409.05243,
  title  = {Mamba-Enhanced Text-Audio-Video Alignment Network for Emotion Recognition in Conversations},
  author = {Xinran Li and Xiaomao Fan and Qingyang Wu and Xiaojiang Peng and Ye Li},
  journal= {arXiv preprint arXiv:2409.05243},
  year   = {2024}
}