中文

学习结合压缩激励的视觉Transformer用于面部表情识别

计算机视觉与模式识别 2021-07-19 v4

摘要

随着过去几十年各类面部表情数据库的可获取,面部表情识别(Facial Expression Recognition, FER)任务获得了大量关注。可用数据库的多种来源为面部识别任务带来了若干挑战。这些挑战通常通过卷积神经网络(Convolution Neural Network, CNN)架构解决。不同于CNN模型,近期提出了一种基于注意力机制的Transformer模型以应对视觉任务。Transformer的一个主要问题是需要大量训练数据,而大多数FER数据库相较于其他视觉应用较为有限。因此,本文中我们提出联合学习一个视觉Transformer与压缩激励(Squeeze and Excitation, SE)块用于FER任务。所提方法在不同公开可用的FER数据库上评估,包括CK+、JAFFE、RAF-DB与SFEW。实验表明我们的模型在CK+与SFEW上优于最先进(state-of-the-art)方法,并在JAFFE与RAF-DB上取得有竞争力的结果。

关键词

引用

@article{arxiv.2107.03107,
  title  = {Learning Vision Transformer with Squeeze and Excitation for Facial Expression Recognition},
  author = {Mouath Aouayeb and Wassim Hamidouche and Catherine Soladie and Kidiyo Kpalma and Renaud Seguier},
  journal= {arXiv preprint arXiv:2107.03107},
  year   = {2021}
}