通过 LLM 知识迁移提升零样人脸表情识别
计算机视觉与模式识别
2024-11-27 v3
摘要
当前的人脸表情识别(FER)模型通常以监督学习方式设计,受限于缺乏大规模带高质量标注的人脸表情图像,因此在推理时对未见图像的泛化能力较差。视觉语言基零样模型展示了应对这一挑战的潜力,但由于缺乏任务特定知识,未针对人脸表情识别的细微差别进行优化。为弥合这一差距,本工作提出一种新方法,Exp-CLIP,通过将大语言模型(LLM)的任务知识迁移到零样 FER 中。具体基于预训练的视觉语言编码器,引入一个投影头,将初始的视觉语言空间映射到捕获人脸动作表征的空间。为训练该投影头以实现零样预测,本文提出将投影后的视觉表征与来自 LLM 编码器的任务特定语义含义对齐,并采用文本指令策略定制 LLM 知识。在无标签人脸数据和高效投影头训练的情况下,Exp-CLIP 在七个野生 FER 数据集上实现了超越 CLIP 模型和其他多个大型视觉语言模型(LVLMs)的优异零样结果。代码和预训练模型已提供:https://github.com/zengqunzhao/Exp-CLIP。
引用
@article{arxiv.2405.19100,
title = {Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer},
author = {Zengqun Zhao and Yu Cao and Shaogang Gong and Ioannis Patras},
journal= {arXiv preprint arXiv:2405.19100},
year = {2024}
}
备注
Accepted at WACV 2025 (Camera-Ready Version)