S$^3$POT:基于自监督提示学习的面部遮挡分割
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
现有的面部解析方法通常误将遮挡区域分类为面部组件。这是因为遮挡是一个高层次概念,它不指指特定的物体类别。因此,构建覆盖所有遮挡物类别的真实世界人脸数据集几乎不可能,而且 accurate mask 标注也十分费力。为此,我们提出了SPOT(SPOT),一个结合面部生成与自监督空间提示的对比驱动框架,用于实现遮挡分割。该框架灵感来源于以下洞见:1)现代面部生成器能够真实地重建被遮挡区域,创建保留面部几何结构但消除遮挡的图像;2)基础分割模型(如SAM)在提供恰当提示时能够提取精确的掩码。具体而言,SPOT包含三个模块:参考生成(RF)、特征增强(FE)和提示选择(PS)。首先,RF利用解析掩码中的结构引导生成参考图像。其次,FE对 raw 与 reference 图像中的 token 进行对比,以获得初始提示,然后通过跨注意力机制修改图像特征。最后,基于增强后的特征,PS构建一组正负提示,并通过自注意力网络筛选用于掩码解码器的提示。该网络在未涉及遮挡 ground truth mask 的情况下,通过三个新颖且互补的目标函数进行学习。在收集的专用数据集上进行大量实验表明,SPOT在性能上显著优于现有方法,且各模块的有效性得到充分验证。
引用
@article{arxiv.2602.00635,
title = {S$^3$POT: Contrast-Driven Face Occlusion Segmentation via Self-Supervised Prompt Learning},
author = {Lingsong Wang and Mancheng Meng and Ziyan Wu and Terrence Chen and Fan Yang and Dinggang Shen},
journal= {arXiv preprint arXiv:2602.00635},
year = {2026}
}