中文

基于视觉 Transformer 与注意力选择性融合的面部表情识别

计算机视觉与模式识别 2022-05-12 v3

摘要

野外面部表情识别(FER)因非受限条件下的遮挡、头部姿态多变、面部形变与运动模糊而极具挑战。尽管过去几十年自动 FER 已取得实质性进展,先前研究主要面向实验室可控 FER。真实世界的遮挡、头部姿态多变及其他问题因这些信息缺失区域与复杂背景无疑增加了 FER 难度。不同于先前纯基于 CNN 的方法,我们认为将面部图像转化为视觉词序列并从全局视角进行表情识别是可行且实用的。因此,我们提出带特征融合的视觉 Transformer(VTFF)通过两个主要步骤解决野外 FER。首先,我们提出注意力选择性融合(ASF)以利用双分支 CNN 生成的两类特征图。ASF 通过全局-局部注意力融合多特征来捕获判别性信息。融合后的特征图随后被展平并投影为视觉词序列。其次,受 Transformer 在自然语言处理中成功的启发,我们提出用全局自注意力对这些视觉词间的关系建模。所提方法在三个公开野外面部表情数据集(RAF-DB、FERPlus 与 AffectNet)上评估。在相同设置下,大量实验表明我们的方法优于其他方法,在 RAF-DB 上以 88.14%、FERPlus 上以 88.81%、AffectNet 上以 61.85% 刷新最优水平。在 CK+ 上的跨数据集评估显示了所提方法良好的泛化能力。

关键词

引用

@article{arxiv.2103.16854,
  title  = {Facial Expression Recognition with Visual Transformers and Attentional Selective Fusion},
  author = {Fuyan Ma and Bin Sun and Shutao Li},
  journal= {arXiv preprint arXiv:2103.16854},
  year   = {2022}
}