Foundation 模型嵌入融合混合情绪:BLEMORE 挑战的多模态融合方法
计算机视觉与模式识别
2026-03-26 v1
摘要
我们 presenting 用于 FG 2026 上混合情绪识别与相对显著性预测挑战的系统。我们的方案通过晚期概率融合结合六类编码器:适配软标签 KL 训练的 S4D-ViTMoE 人脸编码器、冻结层选择的 Wav2Vec2 音频特征、微调的身体语言编码器 (TimeSformer、VideoMAE),以及首次在情绪识别中引入的 Gemini Embedding 2.0 大型多模态模型,其视频嵌入仅需 2 秒输入即可获得竞争性存在准确率 (ACCP = 0.320)。实验三个关键发现:从冻结 Wav2Vec2 中选择包含抑扬特征的层 (6-12) 优于端到端微调 (得分 0.207 vs 0.161),因 BLEMORE 音频的非语言性质使语音层无关紧要;后处理显著性阈值 β 在不同折叠间变化于 0.05 到 0.43,揭示个性化表达风格是主要瓶颈;任务适应编码器整体获得 62% 的集成权重优于通用基线。我们的 12 编码器系统在测试集上取得 Score = 0.279 (ACCP = 0.391, ACCS = 0.168),排名第 6。
引用
@article{arxiv.2603.23650,
title = {Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge},
author = {Masoumeh Chapariniya and Aref Farhadipour and Sarah Ebling and Volker Dellwo and Teodora Vukovic},
journal= {arXiv preprint arXiv:2603.23650},
year = {2026}
}