融合注意力机制的表情掩码自编码器用于面部表情识别
计算机视觉与模式识别
2024-05-14 v3
摘要
面部表情识别(Facial Expression Recognition, FER)是计算机视觉领域中一项关键任务,在多个领域具有广泛的应用。FER 数据集规模有限,制约了表情识别模型的泛化能力,因此解决这一难题对于提升模型性能至关重要。本文提出了一种创新方法,将 MAE-Face 自监督学习(self-supervised learning, SSL)方法与多视角融合注意力机制相结合用于表情分类,并在第六届野外情感行为分析(6th Affective Behavior Analysis in-the-wild, ABAW)竞赛中加以展示。该方法在学习强调人类面部表情变化的高级特征之前,先利用同侧视角(辅助视角)的低级特征信息,从而为改进被检视角(主视角)提供了一种简洁而新颖的途径。我们还提出了易于实现且无需训练的框架,用于突出关键的面部特征,以判断这些特征能否作为模型聚焦关键局部要素的引导。该方法的有效性通过在 Aff-wild2 数据集上训练与验证阶段模型性能的提升得到了验证。
引用
@article{arxiv.2403.13039,
title = {Emotic Masked Autoencoder with Attention Fusion for Facial Expression Recognition},
author = {Bach Nguyen-Xuan and Thien Nguyen-Hoang and Thanh-Huy Nguyen and Nhu Tai-Do},
journal= {arXiv preprint arXiv:2403.13039},
year = {2024}
}
备注
6 pages; added references for section 1; corrected typo for email author