EmoCLIP:一种用于零样本视频面部表情识别的视觉-语言方法
计算机视觉与模式识别
2024-03-19 v2 人机交互
摘要
面部表情识别(FER)是情感计算中的一项关键任务,但其传统上聚焦于七种基本情绪,限制了其在复杂且不断扩展的情绪谱系中的适用性。为解决动态真实场景FER中存在的新颖且未见过的情绪问题,我们提出了一种新颖的视觉-语言模型,该模型利用样本级文本描述(即上下文、表情或情绪线索的说明)作为自然语言监督,旨在增强丰富潜在表征的学习,用于零样本分类。为验证这一点,我们使用在样本级描述上训练的模型在四个流行的动态FER数据集上进行了零样本分类评估。我们的研究结果表明,与基线方法相比,该方法带来了显著改进。具体而言,对于零样本视频FER,我们在多个数据集上以加权平均召回率(Weighted Average Recall)超越CLIP超过10%,以未加权平均召回率(Unweighted Average Recall)超越5%。此外,我们在心理健康症状估计的下游任务上评估了使用样本级描述训练的网络所获得的表征,取得了与最先进(state-of-the-art)方法相当或更优的性能,并与人类专家高度一致。即,我们在精神分裂症症状严重程度估计上取得了高达0.85的皮尔逊相关系数(Pearson's Correlation Coefficient),这与人类专家间的一致性相当。代码已公开于:https://github.com/NickyFot/EmoCLIP。
引用
@article{arxiv.2310.16640,
title = {EmoCLIP: A Vision-Language Method for Zero-Shot Video Facial Expression Recognition},
author = {Niki Maria Foteinopoulou and Ioannis Patras},
journal= {arXiv preprint arXiv:2310.16640},
year = {2024}
}
备注
Accepted at FG'2024