中文

Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models

计算机视觉与模式识别 2025-08-20 v1 人工智能

摘要

面部情感识别(FER)对于人机交互和心理健康诊断等应用至关重要。本研究首次对比评估了开源视觉语言模型(VLM),包括 Phi-3.5 Vision 和 CLIP,与传统深度学习模型 VGG19、ResNet-50 和 EfficientNet-B0 在包含 35,887 张低分辨率灰度图像的七个情感类别上的 FER-2013 数据集表现。为解决 VLM 训练假设与 FER 数据噪声性质之间的矛盾,我们引入一种新型管线,将 GFPGAN 基于图像修复与 FER 评估集成。结果显示,传统模型,特别是 EfficientNet-B0(86.44%)和 ResNet-50(85.72%),显著优于 VLM 如 CLIP(64.07%)和 Phi-3.5 Vision(51.66%),凸显了 VLM 在低质量视觉任务中的局限性。除使用精确率、召回率、F1 分数和准确率进行性能评估外,我们还提供了涵盖预处理、训练、推理和评估阶段的详细计算成本分析,为部署提供实用见解。本工作强调了适应噪声环境中 VLM 的必要性,并为未来情感识别研究提供可复现的基准。

关键词

引用

@article{arxiv.2508.13524,
  title  = {Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models},
  author = {Vamsi Krishna Mulukutla and Sai Supriya Pavarala and Srinivasa Raju Rudraraju and Sridevi Bonthu},
  journal= {arXiv preprint arXiv:2508.13524},
  year   = {2025}
}