中文

一种用于维度情感识别中音视觉融合的联合交叉注意力模型

计算机视觉与模式识别 2024-07-09 v4 人机交互 声音 音频与语音处理

摘要

多模态情感识别近来备受关注,因其可利用跨多模态(如音频、视觉、生物信号等)的多样且互补关系,并能对含噪模态提供一定鲁棒性。大多数最先进的音视觉(A-V)融合方法依赖于循环网络或常规注意力机制,未能有效利用 A-V 模态的互补本质。本文关注基于从视频提取的面部与声音模态融合的维度情感识别。具体而言,我们提出一种联合交叉注意力模型,该模型利用互补关系提取跨 A-V 模态的显著特征,从而实现对效价与唤醒度连续值的准确预测。所提融合模型高效利用了模态间关系,同时降低了特征间的异质性。特别地,它基于组合特征表示与各单独模态间的相关性计算交叉注意力权重。通过将组合的 A-V 特征表示部署于交叉注意力模块中,我们的融合模块性能较原始交叉注意力模块显著提升。在 AffWild2 数据集验证集视频上的实验结果表明,我们所提 A-V 融合模型提供了一种高性价比方案,可优于最先进方法。代码已发布于 GitHub: https://github.com/praveena2j/JointCrossAttentional-AV-Fusion。

关键词

引用

@article{arxiv.2203.14779,
  title  = {A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition},
  author = {R. Gnana Praveen and Wheidima Carneiro de Melo and Nasib Ullah and Haseeb Aslam and Osama Zeeshan and Théo Denorme and Marco Pedersoli and Alessandro Koerich and Simon Bacon and Patrick Cardinal and Eric Granger},
  journal= {arXiv preprint arXiv:2203.14779},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2111.05222