中文

用于维度情感识别的跨注意力音视频融合

计算机视觉与模式识别 2024-07-09 v2 声音 音频与语音处理 图像与视频处理

摘要

多模态分析近来在情感计算中引起广泛关注,因为相较于孤立的单模态方法,它能提高情感识别的整体准确率。用于多模态情感识别的最有效技术充分利用多样且互补的信息源,如面部、声音和生理模态,以提供全面的特征表示。本文中,我们关注基于从视频中提取的面部与声音模态融合的维度情感识别,其中可捕捉复杂的时空关系。现有多数融合技术依赖循环网络或常规注意力机制,未能有效利用音视频(A-V)模态的互补特性。我们引入一种跨注意力融合方法,以提取跨 A-V 模态的显著特征,从而准确预测效价与唤醒度的连续值。我们新的跨注意力 A-V 融合模型高效利用了模态间关系。具体而言,它计算跨注意力权重以聚焦于各模态中贡献更大的特征,进而组合贡献性特征表示,随后送入全连接层以预测效价与唤醒度。所提方法的有效性在 RECOLA 和 Fatigue(私有)数据集的视频上经实验验证。结果表明,我们的跨注意力 A-V 融合模型是一种经济高效的方法,优于 SOTA 融合方法。代码可用:\url{https://github.com/praveena2j/Cross-Attentional-AV-Fusion}

关键词

引用

@article{arxiv.2111.05222,
  title  = {Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition},
  author = {R. Gnana Praveen and Eric Granger and Patrick Cardinal},
  journal= {arXiv preprint arXiv:2111.05222},
  year   = {2024}
}

备注

Accepted in FG2021