中文

SIT-FER:融合语义、实例与文本级信息的半监督面部表情识别

计算机视觉与模式识别 2025-03-25 v1

摘要

半监督深度面部表情识别(SS-DFER)由于在实际场景中难以获取充足的标注数据,正受到日益增长的研究关注。然而,现有 SS-DFER 方法主要依赖生成的语义级伪标签进行监督学习,其不可靠性损害了方法性能与实际可用性。本文提出一种新颖的 SS-DFER 框架,同时融合语义、实例与文本级信息以生成高质量伪标签。具体而言,对于无标注数据,考虑到文本描述与实例表征中所蕴含的丰富知识,我们分别计算面部视觉特征与对应文本特征、实例特征之间的相似度,从而获得文本级与实例级的概率。结合语义级概率,这三个层级的概率被精心聚合以得到最终的伪标签。此外,为增强对有标注数据中 one-hot 标签的利用,我们还引入从文本描述中挖掘的文本嵌入,共同监督模型训练,使面部视觉特征能够在文本空间中展现语义关联。在三个数据集上的实验表明,我们的方法显著优于当前最优的 SS-DFER 方法,甚至超越了全监督基线。代码将开源于 https://github.com/PatrickStarL/SIT-FER。

关键词

引用

@article{arxiv.2503.18463,
  title  = {SIT-FER: Integration of Semantic-, Instance-, Text-level Information for Semi-supervised Facial Expression Recognition},
  author = {Sixian Ding and Xu Jiang and Zhongjing Du and Jiaqi Cui and Xinyi Zeng and Yan Wang},
  journal= {arXiv preprint arXiv:2503.18463},
  year   = {2025}
}