中文

基于联合交叉注意的效价-唤醒空间视听融合情绪识别

计算机视觉与模式识别 2022-09-20 v1

摘要

自动情绪识别(ER)因其在许多现实应用中的潜力而近期受到大量关注。在此背景下,多模态方法通过结合多样且互补的信息源,已被证明可提升性能(优于单模态方法),并对噪声和缺失模态提供一定鲁棒性。在本文中,我们关注基于从视频中提取的面部与声音模态融合的维度化 ER,其中探索互补的视听(A-V)关系以在效价-唤醒空间中预测个体的情绪状态。大多数最先进的融合技术依赖于循环网络或常规注意力机制,不能有效利用 A-V 模态的互补性质。为解决此问题,我们引入了一种用于 A-V 融合的联合交叉注意力模型,其提取跨 A-V 模态的显著特征,能够同时有效利用模态间关系并保留模态内关系。特别地,它基于联合特征表示与各单独模态特征表示之间的相关性计算交叉注意力权重。通过将联合 A-V 特征表示部署到交叉注意力模块中,有助于同时利用模态内与模态间关系,从而显著提升系统相对于原始交叉注意力模块的性能。我们提出的方法的有效性在来自 RECOLA 和 AffWild2 数据集的挑战性视频上进行了实验验证。结果表明,我们的联合交叉注意力 A-V 融合模型提供了一种高性价比方案,即使模态含噪或缺失,也能优于最先进的方法。

关键词

引用

@article{arxiv.2209.09068,
  title  = {Audio-Visual Fusion for Emotion Recognition in the Valence-Arousal Space Using Joint Cross-Attention},
  author = {R Gnana Praveen and Eric Granger and Patrick Cardinal},
  journal= {arXiv preprint arXiv:2209.09068},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2203.14779, arXiv:2111.05222