中文

具有注意力池化的视觉 Transformer 用于鲁棒人脸识别表情识别

计算机视觉与模式识别 2022-12-13 v1

摘要

野外人脸表情识别(FER)是一项极具挑战性的任务。近来,一些视觉 Transformer(ViT)已被探索用于 FER,但其中大多数表现不如卷积神经网络(CNN)。这主要是因为新提出的模块由于缺乏归纳偏置而难以从头良好收敛,且容易聚焦于遮挡与噪声区域。TransFER 作为一种代表性的基于 Transformer 的 FER 方法,通过多分支注意力丢弃缓解了此问题,但带来了过多计算量。相反,我们提出两个注意力池化(AP)模块来直接池化噪声特征。AP 模块包括注意力块池化(APP)与注意力令牌池化(ATP)。它们旨在引导模型强调最具判别性的特征,同时降低较不相关特征的影响。所提 APP 用于选取 CNN 特征上信息量最大的块,而 ATP 丢弃 ViT 中不重要的令牌。由于实现简单且无学习参数,APP 与 ATP 直观地降低了计算成本,同时仅通过追求最具判别性的特征提升了性能。定性结果展示了我们注意力池化的动机与有效性。此外,在六个野外数据集上的定量结果优于其他最先进的方法。

关键词

引用

@article{arxiv.2212.05463,
  title  = {Vision Transformer with Attentive Pooling for Robust Facial Expression Recognition},
  author = {Fanglei Xue and Qiangchang Wang and Zichang Tan and Zhongsong Ma and Guodong Guo},
  journal= {arXiv preprint arXiv:2212.05463},
  year   = {2022}
}

备注

Codes will be public on https://github.com/youqingxiaozhua/APViT