中文

零样本人脸表情识别中基于仍图像的视觉问答策略评估

计算机视觉与模式识别 2025-05-01 v1

摘要

人脸表情识别 (FER) 是计算机视觉和人机交互中的关键研究领域。尽管深度学习方法取得了近期进展,但在新情景下的泛化性仍是挑战。事实上,零样本 FER 显著降低了最先进 FER 模型的性能。为此,社区最近开始探索整合大型语言模型知识以增强视觉任务的做法。本文评估了一系列在本地执行的视觉语言模型 (VLMs),通过采用视觉问答策略来规避任务特定知识不足的问题。我们将所提管道与集成和不集成 VLMs 的最先进 FER 模型进行比较,在著名 FER 基准数据集上进行评估:AffectNet、FERPlus 和 RAF-DB。结果显示,某些 VLMs 在零样本 FER 场景下表现优异,表明需要进一步探索以提高 FER 的泛化性。

关键词

引用

@article{arxiv.2504.21309,
  title  = {An Evaluation of a Visual Question Answering Strategy for Zero-shot Facial Expression Recognition in Still Images},
  author = {Modesto Castrillón-Santana and Oliverio J Santana and David Freire-Obregón and Daniel Hernández-Sosa and Javier Lorenzo-Navarro},
  journal= {arXiv preprint arXiv:2504.21309},
  year   = {2025}
}