中文

通过 LLM 知识迁移提升零样人脸表情识别

计算机视觉与模式识别 2024-11-27 v3

摘要

当前的人脸表情识别(FER)模型通常以监督学习方式设计,受限于缺乏大规模带高质量标注的人脸表情图像,因此在推理时对未见图像的泛化能力较差。视觉语言基零样模型展示了应对这一挑战的潜力,但由于缺乏任务特定知识,未针对人脸表情识别的细微差别进行优化。为弥合这一差距,本工作提出一种新方法,Exp-CLIP,通过将大语言模型(LLM)的任务知识迁移到零样 FER 中。具体基于预训练的视觉语言编码器,引入一个投影头,将初始的视觉语言空间映射到捕获人脸动作表征的空间。为训练该投影头以实现零样预测,本文提出将投影后的视觉表征与来自 LLM 编码器的任务特定语义含义对齐,并采用文本指令策略定制 LLM 知识。在无标签人脸数据和高效投影头训练的情况下,Exp-CLIP 在七个野生 FER 数据集上实现了超越 CLIP 模型和其他多个大型视觉语言模型(LVLMs)的优异零样结果。代码和预训练模型已提供:https://github.com/zengqunzhao/Exp-CLIP。

关键词

引用

@article{arxiv.2405.19100,
  title  = {Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer},
  author = {Zengqun Zhao and Yu Cao and Shaogang Gong and Ioannis Patras},
  journal= {arXiv preprint arXiv:2405.19100},
  year   = {2024}
}

备注

Accepted at WACV 2025 (Camera-Ready Version)