LaCoVL-FER:面向面部表情识别的视觉-语言增强型地标引导对比学习网络
计算机视觉与模式识别
2026-05-20 v1
摘要
由于姿态、遮挡和光照等不可控变化,自然场景下的面部表情识别(FER)仍然具有挑战性。现有的大多数基于注意力的方法主要依赖视觉外观线索,存在注意力冗余和不稳定性问题,限制了它们在复杂场景下的性能。为了解决这些问题,我们提出了一种新颖的面向面部表情识别的视觉-语言增强型地标引导对比学习网络(LaCoVL-FER),该网络融合了来自面部地标的几何先验和来自视觉-语言模型的语义先验。具体来说,我们设计了一个地标引导自适应编码器(LGAE),通过双分支门控交叉注意力(BGCA)机制引入几何先验,实现基于地标的几何特征和视觉外观特征的自适应融合,以产生与表情相关的特征,从而聚焦于关键面部区域并抑制噪声干扰。同时,我们提出了一种视觉-语言增强策略(VLES),利用表情相关特征来细化由冻结的预训练 CLIP 图像编码器提取的可泛化视觉特征,从而生成表情特定的视觉表示。基于这些表示,我们利用表情条件提示(ECP)机制进一步调整来自冻结的预训练 CLIP 文本编码器的固定类别级提示的文本特征,生成更具实例感知能力的文本表示。这些视觉-文本表示被对齐作为语义先验,以增强 FER 的鲁棒性和泛化能力。定量和定性实验表明,我们的 LaCoVL-FER 在三个具有代表性的真实世界 FER 数据集(包括 RAF-DB、FERPlus 和 AffectNet)上优于最先进的方法。代码可在 https://github.com/ylin06804/LaCoVL-FER 获取。
引用
@article{arxiv.2605.19821,
title = {LaCoVL-FER: Landmark-Guided Contrastive Learning Network with Vision-Language Enhancement for Facial Expression Recognition},
author = {Jiaxin Wang and Muwei Jian and Hui Yu and Junyu Dong and Yifan Xia},
journal= {arXiv preprint arXiv:2605.19821},
year = {2026}
}