基于高斯分布的点监督人脸表情 Spotting 及实例自适应强度建模
计算机视觉与模式识别
2026-01-07 v3
摘要
人脸表情 Spotting 是一种旨在识别非裁剪视频中人脸表情实例的自动化方法,对于人脸表情分析至关重要。现有方法主要关注完全监督学习,依赖昂贵且耗时的时序边界标注。在本文中,我们研究了点监督人脸表情 Spotting (P-FES),仅需为每个实例提供一个时间戳标注即可进行训练。我们提出了一种独特的双分支框架用于 P-FES。首先,为了缓解硬伪标签的局限性,这种方法常将中性帧和表情帧混淆并带有各种强度,我们提出了基于高斯分布的实例自适应强度建模 (GIM) 模块,用于为软伪标签建模实例级表情强度分布。通过检测每个点标签周围的伪峰帧、估计持续时间并构建实例级高斯分布,GIM 为更可靠的强度监督在表情帧上分配软伪标签。将 GIM 模块纳入我们的框架以优化类别无关的表情强度分支。其次,我们设计了一个类别感知的峰值分类分支,仅基于伪峰帧区分宏观和微观表情。在推理期间,两个分支独立工作:类别无关的表情强度分支生成表情提案,而类别感知的峰值分类分支负责宏观和微观表情的分类。此外,我们引入一种强度感知的对比损失,以增强判别特征学习并抑制中性噪声,通过对比中性帧与各种强度的表情帧来实现。广泛的在 SAMM-LV、CAS(ME) 和 CAS(ME) 数据集上的实验表明,我们提出的框架有效且高效。
引用
@article{arxiv.2511.16952,
title = {Point-Supervised Facial Expression Spotting with Gaussian-Based Instance-Adaptive Intensity Modeling},
author = {Yicheng Deng and Hideaki Hayashi and Hajime Nagahara},
journal= {arXiv preprint arXiv:2511.16952},
year = {2026}
}
备注
Accepted for publication in IEEE Transactions on Biometrics, Behavior, and Identity Science