基于 YOLOv11 和 YOLOv12 的人脸表情识别:对比研究
计算机视觉与模式识别
2025-11-17 v1
摘要
人脸表情识别在不受约束的真实世界环境中仍是一个具有挑战性的任务。本研究探讨了两种轻量级模型——YOLOv11n 和 YOLOv12n(即最新官方 YOLO 系列的 nano 变体)在统一的检测和分类框架中用于人脸表情识别(FER)的性能。将两个基准分类数据集 FER2013 和 KDEF 转换为目标检测格式,并使用 mAP 0.5、精确率、召回率和混淆矩阵评估模型性能。结果表明,YOLOv12n 在干净的 KDEF 数据集上实现了最高的整体性能,mAP 0.5 为 95.6,也在 FER2013 数据集上超过 YOLOv11n,显示出对不同表情的更强灵敏度。相比之下,YOLOv11n 在 FER2013 上显示出更高的精确率 65.2,表明在噪声较大的真实环境条件下具有更少的误报和更好的可靠性。在 FER2013 上,两种模型在视觉上相似的表情之间显示出更多的混淆,而在更干净的 KDEF 数据集上则观察到更清晰的类别分离。这些发现凸显了灵敏度与精确率之间的权衡,说明轻量级 YOLO 模型如何有效地平衡性能和效率。结果表明这些模型在受控和真实世界条件下都具备良好的适应性,为实时、资源受限的情感感知 AI 应用建立了强大的候选模型。
引用
@article{arxiv.2511.10940,
title = {Facial Expression Recognition with YOLOv11 and YOLOv12: A Comparative Study},
author = {Umma Aymon and Nur Shazwani Kamarudin and Ahmad Fakhri Ab. Nasir},
journal= {arXiv preprint arXiv:2511.10940},
year = {2025}
}
备注
IEEE Conference Proceedings for the 2025 IEEE 9th International Conference on Software Engineering & Computer Systems (ICSECS)