中文

基于回归的情绪识别中用于音视频融合的递归联合注意力

计算机视觉与模式识别 2023-04-18 v1 声音 音频与语音处理

摘要

在基于视频的情绪识别(ER)中,有效利用音频(A)与视觉(V)模态间的互补关系,同时保留各模态自身的模态内特性十分重要。本文提出一种递归联合注意力模型,并结合长短期记忆(LSTM)模块,用于基于回归的 ER 中语音与面部表情的融合。具体而言,我们研究了以递归方式利用联合交叉注意力模型与 LSTM 来挖掘 A 和 V 模态互补性的可能,以捕获同一模态内的模态内时间依赖关系以及 A-V 特征表示间的关系。通过将 LSTM 与递归联合交叉注意力结合,我们的模型能高效利用模态内与模态间关系来实现 A 和 V 模态的融合。在具有挑战性的 Affwild2 和 Fatigue(私有)数据集上进行的大量实验表明,所提出的 A-V 融合模型显著优于最先进方法。

关键词

引用

@article{arxiv.2304.07958,
  title  = {Recursive Joint Attention for Audio-Visual Fusion in Regression based Emotion Recognition},
  author = {R Gnana Praveen and Eric Granger and Patrick Cardinal},
  journal= {arXiv preprint arXiv:2304.07958},
  year   = {2023}
}