中文

FineCLIPER:用于动态面部表情识别的多模态细粒度CLIP with AdaptERs

计算机视觉与模式识别 2025-06-25 v3 人机交互

摘要

动态面部表情识别(DFER)对于理解人类行为至关重要。然而,当前方法主要由于数据稀缺、面部动态利用不足以及表情语义模糊等问题导致性能有限。为此,我们提出了一种新框架,命名为用于动态面部表情识别的带AdaptERs的多模态细粒度CLIP(FineCLIPER),其包括以下创新设计:1)为更好地区分相似的面部表情,我们将类别标签扩展为来自正面和负面两个方面的文本描述,并通过计算CLIP模型中的跨模态相似性来获得监督信号;2)我们的FineCLIPER采用分层方式有效地从DFE视频中挖掘有用线索。具体而言,除了直接将视频帧作为输入(低语义层次)外,我们提出在每个帧上提取面部分割掩码和关键点(中等语义层次),并利用设计了提示词的多模态大语言模型(MLLM)进一步生成描述帧之间面部变化的详细描述(高语义层次)。此外,我们还采用参数高效微调(PEFT)来高效适配大型预训练模型(即CLIP)以完成此任务。我们的FineCLIPER在DFE、FERV39k和MAFW数据集上在有监督和零样态设置下均实现了SOTA性能,参数可调数量极少。项目页面:https://haroldchen19.github.io/FineCLIPER-Page/

关键词

引用

@article{arxiv.2407.02157,
  title  = {FineCLIPER: Multi-modal Fine-grained CLIP for Dynamic Facial Expression Recognition with AdaptERs},
  author = {Haodong Chen and Haojian Huang and Junhao Dong and Mingzhe Zheng and Dian Shao},
  journal= {arXiv preprint arXiv:2407.02157},
  year   = {2025}
}

备注

Accepted to ACM MM 2024