使用挤压激励增强的Swin Transformer进行面部表情识别
计算机视觉与模式识别
2023-05-03 v7
摘要
识别与解读面部情绪是人类交流的关键组成部分,它使个体能够理解并回应通过面部表情与声调传达的情绪。面部情绪识别是一个复杂的认知过程,涉及视觉与听觉信息的整合,以及先验知识与社会线索。它在社会交互、情感加工与共情中扮演关键角色,并且是许多人机交互、虚拟助手以及心理健康诊断与治疗等实际应用的重要方面。因此,开发准确高效的面部情绪识别模型极为重要,并有可能对多个研究领域产生显著影响。面部情绪识别(FER)在计算机视觉与人工智能领域意义重大,在安防、广告与娱乐等领域具有广阔的商业与学术潜力。我们提出一种采用Swin Vision Transformers(SwinT)与挤压激励块(SE)处理视觉任务的FER框架。该方法使用带注意力机制、SE与SAM的Transformer模型以提升效率,因为Transformer常需大量数据。我们的重点是创建基于SwinT架构、能用最少数据识别面部情绪的高效FER模型。我们在混合数据集上训练模型,并在AffectNet数据集上评估,取得0.5420的F1分数,超越了2022年欧洲计算机视觉会议(ECCV)上举行的野外情感行为分析(ABAW)竞赛的冠军~\cite{Kollias}。
引用
@article{arxiv.2301.10906,
title = {Facial Expression Recognition using Squeeze and Excitation-powered Swin Transformers},
author = {Arpita Vats and Aman Chadha},
journal= {arXiv preprint arXiv:2301.10906},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2103.14030 by other authors