不一致感知交叉注意力用于维度情感识别中的音视频融合
计算机视觉与模式识别
2024-07-02 v2
摘要
利用跨模态的互补关系最近在多模态情感识别中引起了广泛关注。大多数现有方法探索了交叉注意力来捕获跨模态的互补关系。然而,模态之间也可能表现出弱的互补关系,这可能会恶化交叉注意力特征,导致多模态特征表示不佳。为了解决这个问题,我们提出了不一致感知交叉注意力(IACA),它可以根据音频和视觉模态之间的强或弱互补关系,自适应地即时选择最相关的特征。具体来说,我们设计了一个两阶段门控机制,可以自适应地选择适当的相关特征来处理弱互补关系。在具有挑战性的Aff-Wild2数据集上进行了大量实验,以证明所提模型的鲁棒性。
引用
@article{arxiv.2405.12853,
title = {Inconsistency-Aware Cross-Attention for Audio-Visual Fusion in Dimensional Emotion Recognition},
author = {G Rajasekhar and Jahangir Alam},
journal= {arXiv preprint arXiv:2405.12853},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2403.19554