重新思考面部表情识别中的遮挡:语义感知视角及突破
计算机视觉与模式识别
2025-07-25 v3
摘要
面部表情识别(FER)因普遍遮挡和数据集偏差而具有挑战性,尤其当面部信息部分遮挡时,现有 FER 模型难以提取有效面部特征,导致分类不准确。为此,我们提出了 ORSANet,其引入了以下三个关键贡献:首先,我们引入辅助多模态语义指导来消除面部遮挡并学习高层语义知识,这有两方面:1)我们引入语义分割图作为稠密语义先验,以生成语义增强的面部表征;2)我们引入面部关键点作为稀疏几何先验,以缓解 FER 中的内在噪声,如身份和性别偏差。其次,为促进这两种多模态先验的有效集成,我们定制了多尺度交互模块(MCM),在不同尺度上自适应融合关键点特征和语义增强表征。最后,我们设计了动态对抗排斥增强损失函数(DARELoss),动态调整模糊类别的间距,进一步增强模型区分相似表情的能力。我们进一步构建了第一个面向遮挡的 FER 数据集,以便对各种现实世界遮挡条件进行专业鲁棒性分析,称为 Occlu-FER。在公共基准数据集和 Occlu-FER 上的大量实验表明,我们提出的 ORSANet 实现了 SOTA 识别性能。代码已公开于 https://github.com/Wenyuzhy/ORSANet-master。
引用
@article{arxiv.2507.15401,
title = {Rethinking Occlusion in FER: A Semantic-Aware Perspective and Go Beyond},
author = {Huiyu Zhai and Xingxing Yang and Yalan Ye and Chenyang Li and Bin Fan and Changze Li},
journal= {arXiv preprint arXiv:2507.15401},
year = {2025}
}