中文

基于双向跨注意力和时序建模的多模态情感识别

计算机视觉与模式识别 2026-03-19 v2 人工智能

摘要

面对野外视频数据中的表情识别仍具有挑战性,这些数据在面部外观、背景条件、音频噪声以及人类情感本质动态性质方面存在显著变化。仅依赖单一模态(如面部表情或语音)往往不足以捕获这些复杂的情感线索。为此,我们提出一种用于10th Affective Behavior Analysis in-the-wild(ABAW)挑战中Expression(EXPR)任务的多模态情感识别框架。该框架基于大规模预训练模型进行视觉和音频表征学习,并将其集成到统一的多模态架构中。为更好地捕获面部表情序列中的时序模式,我们包含视频窗口上的时序视觉建模。我们进一步引入双向跨注意力融合模块,使视觉和音频特征能够以对称方式相互作用,促进跨模态情境化和互补情感理解。此外,我们采用文本引导的对比目标,以鼓励通过与情感相关文本提示的对齐来实现语义上有意义的视觉表征。在ABAW 10th EXPR基准上的实验结果表明,所提出的框架有效,达到了0.32的宏平均F1分数,远高于基线的0.25,突显了结合时序视觉建模、音频表征学习和跨模态融合对于在不受约束的真实世界环境中实现稳健情感识别的优势。

关键词

引用

@article{arxiv.2603.11971,
  title  = {Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling},
  author = {Junhyeong Byeon and Jeongyeol Kim and Sejoon Lim},
  journal= {arXiv preprint arXiv:2603.11971},
  year   = {2026}
}

备注

7 pages