面向人脸情绪表达识别的 two-stage 双模态模型
摘要
本文针对第 10 届情感行为分析 in-the-wild (ABAW) 工作坊与竞赛中的表达 (EXPR) 识别挑战进行了解决,该任务要求对来自不受约束视频的八种人脸情绪表达进行帧级分类。这一任务因人脸定位不准、姿态和尺寸变化大、运动模糊、相邻帧之间的时间不稳定等各种干扰因素而具有挑战性。我们提出了一个 two-stage 双模态(音频-视频)模型以解决这些问题。阶段 I 侧重于健壮的视觉特征提取,采用预训练的 DINOv2 编码器。具体而言,使用 DINOv2 ViT-L/14 作为主干网络,采用填充感知数据增强 (PadAug) 策略进行图像填充和来自原始视频的数据预处理,引入混合专家 (MoE) 训练头以增强分类器多样性。阶段 II 解决模态融合和时间一致性问题。对于视觉模态,面部特征从原始视频中以多个尺度重新裁剪,提取的视觉特征被平均以形成稳健的帧级表示。同时,从短音频窗口中提取与帧对齐的 Wav2Vec 2.0 音频特征,以提供补充的声学线索。这些双模态特征通过轻量级门控融合模块集成,随后进行推理时的时间平滑。ABAW 数据集上的实验表明,所提方法有效。该 two-stage 模型在官方验证集上获得 Macro-F1 分数为 0.5368,在 5 折交叉验证下为 0.5122 ± 0.0277,超越了官方基准。
引用
@article{arxiv.2603.12221,
title = {A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition},
author = {Jiajun Sun and Zhe Gao},
journal= {arXiv preprint arXiv:2603.12221},
year = {2026}
}
备注
Camera-ready version. 14 pages, 5 figures in total: 8 pages main text with 4 figures, 3 pages references, and 3 pages appendix with 1 figure. Accepted at the 10th ABAW Workshop, CVPR 2026