10届ABAW竞赛团队RAS:多模态价值和 arousal 估计方法
计算机视觉与模式识别
2026-03-16 v1 人工智能
摘要
在野外(ITW)条件下基于价值和 arousal 的连续情感识别仍是一个具有挑战性的问题,由于外观、头部姿态、照明、遮挡以及主体特定的情感表达模式存在较大变化。我们提出了一种多模态方法,用于ITW情境下的价值- arousal估计。该方法结合了三种互补模态:面部、行为和音频。面部模态依赖于基于GRADA的帧级嵌入和基于Transformer的时序回归。我们使用Qwen3-VL-4B-Instruct从视频片段中提取与行为相关的信息,而Mamba用于建模跨片段的时序动态。音频模态依赖于 WavLM-Large 配合注意力统计池化,并包括一个跨模态过滤阶段以减少不可靠或非语音片段的影响。为融合模态,我们探索了两种融合策略:一种是基于有向跨模态Mixture-of-Experts融合策略,该策略通过自适应加权学习模态间的相互作用;另一种是可靠性感知的音视频融合策略,该策略在帧级结合视觉特征,同时将音频作为补充上下文。结果按10届情感行为分析在野外(ABAW)挑战方案报告。在实验中,我们的方法实现了在Aff-Wild2开发集上达到0.658的Concordance Correlation Coefficient (CCC)。
引用
@article{arxiv.2603.13056,
title = {Team RAS in 10th ABAW Competition: Multimodal Valence and Arousal Estimation Approach},
author = {Elena Ryumina and Maxim Markitantov and Alexandr Axyonov and Dmitry Ryumin and Mikhail Dolgushin and Denis Dresvyanskiy and Alexey Karpov},
journal= {arXiv preprint arXiv:2603.13056},
year = {2026}
}
备注
8 pages, 1 figure