中文

用于面部表情识别的姿态自适应分层注意力网络

计算机视觉与模式识别 2019-05-27 v1

摘要

多视角面部表情识别(FER)是一项具有挑战性的任务,因为表情的外观随姿态而变化。为减轻姿态的影响,近期方法要么进行姿态归一化,要么为每个姿态学习独立的 FER 分类器。然而,这些方法通常具有两阶段且依赖于姿态估计器的良好性能。不同于现有方法,我们提出一种姿态自适应分层注意力网络(PhaNet),可在无约束环境中联合识别面部表情与姿态。具体而言,PhaNet 通过分层尺度上的注意力机制发现与面部表情最相关的区域,然后选择信息量最大的尺度来学习姿态不变且具表情判别性的表示。PhaNet 通过最小化分层注意力损失、FER 损失与姿态损失(具有动态学习的损失权重)而端到端可训练。我们在三个多视角数据集(BU-3DFE、Multi-pie 和 KDEF)以及两个真实场景 FER 数据集(AffectNet 和 SFEW)上验证了所提 PhaNet 的有效性。大量实验表明,我们的框架在数据集内与跨数据集设定下均优于当前最优方法,分别取得了 84.92%、93.53%、88.5%、54.82% 和 31.25% 的平均准确率。

关键词

引用

@article{arxiv.1905.10059,
  title  = {Pose-adaptive Hierarchical Attention Network for Facial Expression Recognition},
  author = {Yuanyuan Liu and Jiyao Peng and Jiabei Zeng and Shiguang Shan},
  journal= {arXiv preprint arXiv:1905.10059},
  year   = {2019}
}

备注

12 pages, 15 figures