中文

利用基于多架构表征的集成学习与蒸馏在真实场景中识别面部表情

计算机视觉与模式识别 2021-08-23 v3

摘要

面部表情是最普遍的通用肢体语言形式。过去几年中,自动面部表情识别(FER)一直是一个活跃的研究领域。然而,由于各种不确定性和复杂性,它仍是一项具有挑战性的任务。尽管如此,效率和性能仍是构建鲁棒系统的关键方面。我们提出了两个模型:EmoXNet,一种用于学习卷积面部表征的集成学习技术;以及 EmoXNetLite,一种蒸馏技术,可利用标签平滑的软标签将集成模型的知识迁移到高效的深度神经网络,从而能够实时有效地检测表情。两种技术均表现良好,其中集成模型(EmoXNet)在带 FER+ 标注的 FER2013 上取得了 85.07% 的测试准确率,在 RAF-DB 上取得了 86.25% 的测试准确率。此外,蒸馏模型(EmoXNetLite)在带 FER+ 标注的 FER2013 上展示了 82.07% 的测试准确率,在 RAF-DB 上展示了 81.78% 的测试准确率。结果表明,我们的模型在新数据上似乎具有良好泛化能力,并学会了聚焦于与表情识别相关的面部表征。

关键词

引用

@article{arxiv.2106.16126,
  title  = {Recognizing Facial Expressions in the Wild using Multi-Architectural Representations based Ensemble Learning with Distillation},
  author = {Rauf Momin and Ali Shan Momin and Khalid Rasheed and Muhammad Saqib},
  journal= {arXiv preprint arXiv:2106.16126},
  year   = {2021}
}

备注

6 pages, 3 figures, 4 tables