用于面部表情识别的多模态提示对齐
计算机视觉与模式识别
2025-06-27 v1 人工智能
摘要
提示学习已被广泛采用,以高效地将 CLIP 等视觉语言模型(VLM)适配至各种下游任务。尽管取得了成功,但当前基于 VLM 的面部表情识别(FER)方法难以捕获细粒度的文本-视觉关系,而这对于区分面部表情之间的细微差异至关重要。为应对这一挑战,我们提出了一个用于 FER 的多模态提示对齐框架,称为 MPA-FER,它为提示视觉特征的学习过程提供细粒度的语义指导,从而产生更精确且可解释的表示。具体而言,我们引入了一种多粒度硬提示生成策略,利用 ChatGPT 等大型语言模型(LLM)为每种面部表情生成详细描述。通过最小化软提示与硬提示之间的特征差异,将基于 LLM 的外部知识注入到软提示中。为保留预训练 CLIP 模型的泛化能力,我们的方法结合了原型引导的视觉特征对齐,确保来自冻结图像编码器的提示视觉特征与特定类别的原型紧密对齐。此外,我们提出了一个跨模态全局-局部对齐模块,聚焦于与表情相关的面部特征,进一步改善了文本与视觉特征之间的对齐。大量实验表明,我们的框架在三个 FER 基准数据集上优于 SOTA 方法,同时保留了预训练模型的优势并最大程度地降低了计算成本。
引用
@article{arxiv.2506.21017,
title = {Multimodal Prompt Alignment for Facial Expression Recognition},
author = {Fuyan Ma and Yiran He and Bin Sun and Shutao Li},
journal= {arXiv preprint arXiv:2506.21017},
year = {2025}
}
备注
To appear in ICCV2025