SegFace:长尾类别人脸分割
计算机视觉与模式识别
2024-12-12 v1
摘要
人脸解析指的是将人脸语义分割为眼睛、鼻子、头发等关键面部区域。它是各种高级应用的前置条件,包括人脸编辑、人脸交换和人脸化妆,这些应用通常需要针对眼镜、帽子、耳环和项链等类的分割掩码。这些不频繁出现的类称为长尾类别,而更频繁出现的类称为 head classes。现有方法主要基于 CNN,训练时以 head classes 为主导,导致长尾类别表示次佳。以往工作大多忽视了长尾类别分割性能差的问题。为解决此问题,我们提出 SegFace,一种简单且高效的方法,使用轻量级 transformer 模型并利用可学习的 class-specific tokens。transformer 解码器利用 class-specific tokens,使每个 token 专注于其对应的类,从而实现对每个类的独立建模。该方法提高了长尾类别的性能,从而提升整体性能。据我们所知,SegFace 是首次使用 transformer 模型进行人脸解析。此外,我们的方法可适用于低计算端设备,实现 95.96 FPS。我们进行了大量实验,表明 SegFace 在 CelebAMask-HQ 数据集上实现 88.96 的平均 F1 分数 (+2.82),在 LaPa 数据集上实现 93.03 (+0.65),显著优于先前 SOTA 模型。代码:https://github.com/Kartik-3004/SegFace。
引用
@article{arxiv.2412.08647,
title = {SegFace: Face Segmentation of Long-Tail Classes},
author = {Kartik Narayan and Vibashan VS and Vishal M. Patel},
journal= {arXiv preprint arXiv:2412.08647},
year = {2024}
}
备注
Accepted to AAAI 2025. Project Page: https://kartik-3004.github.io/SegFace/