中文

基于空间动作单元线索的引导式可解释面部表情识别

计算机视觉与模式识别 2024-05-15 v5

摘要

尽管用于面部表情识别(FER)的最先进分类器能够达到很高的准确率,但它们缺乏可解释性,这对于终端用户而言是一项重要特征。专家通常将码本中的空间动作单元(\aus)与面部区域关联,以对表情进行视觉解释。本文遵循了相同的专家步骤。提出了一种新的学习策略,将 \au 线索显式地纳入分类器训练中,从而训练出深度可解释模型。在训练期间,使用该 \au 码本,连同输入图像的表情标签和面部特征点,构建一个 \au 热力图,以指示与面部表情相关的最具判别性的图像感兴趣区域。利用这一有价值的空间线索来训练用于 FER 的深度可解释分类器。这是通过约束分类器的空间层特征使其与 \au 热力图相关联来实现的。使用复合损失函数,训练分类器在对图像进行正确分类的同时,产生与 \au 图相关的可解释的逐层视觉注意力,从而模拟专家的决策过程。我们的策略仅依赖图像表情类别进行监督,无需额外的手动标注。我们的新策略具有通用性,可应用于任何基于深度 CNN 或 Transformer 的分类器,而无需任何架构改变或显著的额外训练时间。我们在 \rafdb 和 \affectnet 两个公开基准数据集上的广泛评估表明,我们提出的策略能够提高逐层可解释性,且不会降低分类性能。此外,我们探索了依赖类激活映射(CAM)方法的常见可解释分类器类型,并表明我们的方法也能提升 CAM 的可解释性。

关键词

引用

@article{arxiv.2402.00281,
  title  = {Guided Interpretable Facial Expression Recognition via Spatial Action Unit Cues},
  author = {Soufiane Belharbi and Marco Pedersoli and Alessandro Lameiras Koerich and Simon Bacon and Eric Granger},
  journal= {arXiv preprint arXiv:2402.00281},
  year   = {2024}
}

备注

15 pages, 11 figures, 3 tables, International Conference on Automatic Face and Gesture Recognition (FG 2024)