中文

团结则立,分裂则败:处理音频-视觉情绪识别中弱互补关系

计算机视觉与模式识别 2025-03-24 v2 声音 音频与语音处理

摘要

音频和视觉模态是视频中两个主要的非接触式通道,通常被认为彼此之间具有互补关系。然而,它们并非总是互补的,从而导致音频-视觉特征表示不佳。在本文中,我们引入了门控递归联合交叉注意力(GRJCA),利用门控机制自适应地选择最相关的特征,以有效捕捉音频和视觉模态之间的协同关系。具体而言,我们通过引入门控机制来改善递归联合交叉注意力(RJCA)的性能,该机制根据互补关系的强弱控制多个迭代中输入特征与注意力特征之间的信息流。例如,如果模态表现出强互补关系,门控机制强调交叉注意力特征,否则强调非注意力特征。为进一步提高系统性能,我们还探索了分层门控方法,在每次迭代中引入门控机制,然后在各次迭代的门控输出之间进行高层门控。所提出的方法通过增加更多灵活性来处理音频和视觉模态之间的弱互补关系,从而改善了RJCA模型的性能。在具有挑战性的Affwild2数据集上进行了大量实验以证明所提出方法的鲁棒性。通过有效处理音频和视觉模态之间的弱互补关系,所提出的模型在测试集(验证集)上分别实现了效价0.561(0.623)和唤醒度0.620(0.660)的Concordance Correlation Coefficient(CCC)。

关键词

引用

@article{arxiv.2503.12261,
  title  = {United we stand, Divided we fall: Handling Weak Complementary Relationships for Audio-Visual Emotion Recognition in Valence-Arousal Space},
  author = {R. Gnana Praveen and Jahangir Alam and Eric Charton},
  journal= {arXiv preprint arXiv:2503.12261},
  year   = {2025}
}

备注

Achieved 2nd place in valence arousal challenge Submission to CVPR2025 Workshop