MER-CLIP:基于动作单元引导的视觉-语言对齐用于微表情识别
人机交互
2025-05-12 v1
摘要
作为一种关键的心理应激反应,微表情(MEs)是揭示真实情感的短暂而细微的面部运动。自动微表情识别(MER)在刑事侦查和心理诊断等领域具有宝贵的应用价值。面部动作编码系统(FACS)通过识别特定面部动作单元(AUs)的激活来编码表情,是微表情分析的关键参考。然而,当前的 MER 方法通常将 AU 的利用限制在定义感兴趣区域(ROIs)或依赖特定的先验知识,往往导致性能有限和泛化能力差。为解决这一问题,我们将 CLIP 模型强大的跨模态语义对齐能力集成到 MER 中,并提出了一种名为 MER-CLIP 的新方法。具体来说,我们将 AU 标签转换为面部肌肉运动的详细文本描述,通过对齐视觉动态和基于 AU 的文本表示来引导细粒度的时空微表情学习。此外,我们引入了一个情感推理模块,以更高层次的语义理解捕捉微表情模式与情感之间的细微关系。为缓解因微表情数据稀缺导致的过拟合,我们提出了 LocalStaticFaceMix,这是一种有效的数据增强策略,通过混合面部图像来增强面部多样性,同时保留关键的微表情特征。最后,在四个基准微表情数据集上的综合实验证实了 MER-CLIP 的优越性。值得注意的是,在 CAS(ME)3 数据集上,对于 3 类、4 类和 7 类分类任务,UF1 分数分别达到了 0.7832、0.6544 和 0.4997,显著优于先前的方法。
引用
@article{arxiv.2505.05937,
title = {MER-CLIP: AU-Guided Vision-Language Alignment for Micro-Expression Recognition},
author = {Shifeng Liu and Xinglong Mao and Sirui Zhao and Peiming Li and Tong Xu and Enhong Chen},
journal= {arXiv preprint arXiv:2505.05937},
year = {2025}
}