ProS:基于原型的自蒸馏人脸全表示学习
计算机视觉与模式识别
2023-11-08 v2
摘要
本文提出一种名为基于原型的自蒸馏(ProS)的新方法,用于无监督人脸表示学习。现有的有监督方法严重依赖大量带标注的训练人脸数据,这在数据收集和隐私保护方面带来了挑战。为解决这些问题,我们提出 ProS,其利用海量无标注人脸图像来学习全面的人脸全表示(facial omni-representation)。具体而言,ProS 由两个视觉Transformer(vision transformer,教师与学生模型)组成,以不同的增强图像(裁剪、模糊、着色等)进行训练。此外,我们构建了一个人脸感知检索系统并结合增强操作,以获取主要由人脸区域构成的精选图像。为增强所学特征的判别性,我们引入基于原型的匹配损失,将特征(教师或学生)与一组可学习原型之间的相似度分布对齐。预训练后,教师视觉Transformer作为骨干网络用于下游任务,包括属性估计、表情识别和关键点对齐,仅需通过添加额外层进行简单微调即可实现。大量实验表明,我们的方法在完整与少样本设置下的各类任务中均达到了最先进(state-of-the-art,SOTA)性能。此外,我们还探究了使用合成人脸图像进行预训练,ProS 在该场景下同样展现出有前景的性能。
引用
@article{arxiv.2311.01929,
title = {ProS: Facial Omni-Representation Learning via Prototype-based Self-Distillation},
author = {Xing Di and Yiyu Zheng and Xiaoming Liu and Yu Cheng},
journal= {arXiv preprint arXiv:2311.01929},
year = {2023}
}
备注
This paper has been accepted in WACV2024