基于 Transformer 编码器与音视频融合的 ABAW5 挑战赛面部情感识别
计算机视觉与模式识别
2023-03-21 v2
摘要
在本文中,我们展示了为第五届野外情感行为分析研讨会与竞赛(ABAW)提出的方案,该竞赛包含四个子挑战:效价-唤醒度(VA)估计、表情(Expr)分类、动作单元(AU)检测与情绪反应强度(ERI)估计。第五届 ABAW 竞赛聚焦于利用不同模态与数据集进行面部情感识别。在我们的工作中,我们使用大量 sota 模型提取强大的音频与视觉特征。这些特征通过 Transformer Encoder 与 TEMMA 进行融合。此外,为避免不同特征间可能存在的大维度差异影响,我们设计了一个仿射模块将不同特征对齐到同一维度。大量实验证明了所提方法的优越性。对于 VA 估计子挑战,我们的方法获得了 0.6066 的平均一致性相关系数(CCC)。对于表情分类子挑战,平均 F1 分数为 0.4055。对于 AU 检测子挑战,平均 F1 分数为 0.5296。对于情绪反应强度估计子挑战,验证集上的平均皮尔逊相关系数为 0.3968。四个子挑战的所有结果均以较大优势超越基线。
引用
@article{arxiv.2303.09158,
title = {Facial Affect Recognition based on Transformer Encoder and Audiovisual Fusion for the ABAW5 Challenge},
author = {Ziyang Zhang and Liuwei An and Zishun Cui and Ao xu and Tengteng Dong and Yueqi Jiang and Jingyi Shi and Xin Liu and Xiao Sun and Meng Wang},
journal= {arXiv preprint arXiv:2303.09158},
year = {2023}
}