用于维度情感识别中多模态融合的递归联合跨模态注意力
计算机视觉与模式识别
2024-04-16 v4 声音
音频与语音处理
摘要
尽管多模态情感识别近年来取得了显著进展,但跨模态间丰富的协同关系潜力尚未被充分挖掘。在本文中,我们引入了递归联合跨模态注意力(RJCMA),以有效捕获音频、视觉和文本模态间的模态内和模态间关系,用于维度情感识别。具体来说,我们基于联合音-视-文特征表示与各单模态特征表示之间的互相关来计算注意力权重,以同时捕获跨模态的模态内和模态间关系。单模态的注意力特征再次通过递归机制作为输入馈送到融合模型,以获得更精细的特征表示。我们还探索了时间卷积网络(TCN)来改进单模态特征表示的时间建模。我们进行了广泛的实验,以评估所提出的融合模型在具有挑战性的 Affwild2 数据集上的性能。通过有效捕获音频、视觉和文本模态间的协同模态内和模态间关系,所提出的融合模型在验证集(测试集)上的效价和唤醒度一致性相关系数(CCC)分别达到了 0.585 (0.542) 和 0.674 (0.619)。这相较于验证集(测试集)上效价和唤醒度分别为 0.240 (0.211) 和 0.200 (0.191) 的基线有了显著提升,在第六届野外情感行为分析(ABAW)竞赛的效价-唤醒度挑战中获得了第二名。
引用
@article{arxiv.2403.13659,
title = {Recursive Joint Cross-Modal Attention for Multimodal Fusion in Dimensional Emotion Recognition},
author = {R. Gnana Praveen and Jahangir Alam},
journal= {arXiv preprint arXiv:2403.13659},
year = {2024}
}