面向动态面部表情识别的视觉-语言模型提示方法
计算机视觉与模式识别
2024-11-27 v3
摘要
本文提出一种名为 DFER-CLIP 的新型视觉-语言模型,其基于 CLIP 模型并专为真实场景下的动态面部表情识别(DFER)而设计。具体而言,所提 DFER-CLIP 由视觉部分与文本部分组成。对于视觉部分,基于 CLIP 图像编码器,引入由若干 Transformer 编码器组成的时间模型以提取时间面部表情特征,并最终以可学习的“类”令牌作为特征嵌入。对于文本部分,我们将与待识别类别(面部表情)相关的面部行为文本描述作为输入——这些描述由 ChatGPT 等大型语言模型生成。这与仅使用类名的工作形成对比,并能更准确地捕捉类别间关系。除文本描述外,我们引入一个可学习令牌,帮助模型在训练中为每种表情学习相关上下文信息。大量实验证明了所提方法的有效性,并表明我们的 DFER-CLIP 在 DFEW、FERV39k 和 MAFW 基准上相较当前有监督 DFER 方法也取得了最先进(SOTA)结果。代码已公开于 https://github.com/zengqunzhao/DFER-CLIP。
引用
@article{arxiv.2308.13382,
title = {Prompting Visual-Language Models for Dynamic Facial Expression Recognition},
author = {Zengqun Zhao and Ioannis Patras},
journal= {arXiv preprint arXiv:2308.13382},
year = {2024}
}
备注
Accepted at BMVC 2023 (Camera-Ready Version)