中文

基于 EfficientNetB2 的 FER-2013 面部情感识别方法

计算机视觉与模式识别 2026-01-27 v1 机器学习

摘要

在真实场景中基于面部图像检测人类情感是一项困难的任务,原因包括图像质量低、光照变化、姿态变化、背景干扰、类间差异小、众包标签含噪以及严重的类别不平衡,正如在 48x48 灰度图像的 FER-2013 数据集中所观察到的那样。尽管近期使用大型 CNN(如 VGG 和 ResNet)的方法取得了合理的准确率,但它们计算成本高且内存消耗大,限制了其在实时应用中的实用性。我们使用基于 EfficientNetB2 的轻量级高效面部情感识别流程来解决这些挑战,该模型采用两阶段预热与微调策略进行训练。模型通过 AdamW 优化、解耦权重衰减、标签平滑(epsilon = 0.06)以减少标注噪声、截断类权重以缓解类别不平衡进行增强,并结合 dropout、混合精度训练和广泛的实时数据增强。模型使用分层的 87.5%/12.5% 训练-验证划分进行训练,同时保持官方测试集不变,在参数量比基于 VGG16 的基线少近十倍的情况下,实现了 68.78% 的测试准确率。包括逐类指标和学习动态在内的实验结果证明了稳定的训练和强大的泛化能力,使所提出的方法适用于实时和基于边缘的应用。

关键词

引用

@article{arxiv.2601.18228,
  title  = {Facial Emotion Recognition on FER-2013 using an EfficientNetB2-Based Approach},
  author = {Sahil Naik and Soham Bagayatkar and Pavankumar Singh},
  journal= {arXiv preprint arXiv:2601.18228},
  year   = {2026}
}

备注

6 pages, 4 figures