中文

基于跨注意力的音视频变换器融合的多模态情感识别

多媒体 2026-01-21 v4 计算与语言 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

多模态情感识别(MER)旨在通过联合建模音频和视觉线索来推断人类情感;然而,现有方法往往在时序错位、特征表示弱判别性以及异构模态融合 suboptimal方面受限。为解决这些挑战,我们提出了AVT-CA,即一种基于跨注意力的音视频变换器架构,用于稳健的情感识别。该模型引入了层次化视频特征表示,结合通道注意力、空间注意力和局部特征提取,以强调情感关键区域同时抑制无关信息。这些精炼后的视觉特征通过基于变换器的中间融合机制与音频表示集成,捕获跨模态的时序依赖。此外,跨注意力模块选择性地强化相互一致的音视频线索,实现有效的特征选择和噪声感知融合。广泛的实验在三个基准数据集上进行,包括CMU-MOSEI、RAVDESS和CREMA-D,结果表明AVT-CA在准确率和F1分数方面 consistently 超过了最先进的基线方法。我们的源代码已公开available at https://github.com/shravan-18/AVTCA。

关键词

引用

@article{arxiv.2407.18552,
  title  = {Multimodal Emotion Recognition using Audio-Video Transformer Fusion with Cross Attention},
  author = {Joe Dhanith P R and Shravan Venkatraman and Vigya Sharma and Santhosh Malarvannan},
  journal= {arXiv preprint arXiv:2407.18552},
  year   = {2026}
}