一种用于自监督人脸表征生成的框架
计算机视觉与模式识别
2024-05-24 v4
摘要
自监督表征学习因不依赖配对数据集而具有强泛化能力,日益受到关注。然而,其在人脸表征方面尚未得到充分探索。由于人脸身份、表情与姿态和光照等外部因素的耦合,自监督人脸表征学习仍未解决。先前方法主要关注对比学习和像素级一致性,导致可解释性有限且性能次优。本文中,我们提出LatentFace,一种用于自监督人脸表征的新型生成框架。我们认为解耦问题也可表述为空间与时间上的生成目标,并给出基于3D感知潜在扩散模型的解决方案。首先,我们引入3D感知自动编码器将人脸图像编码为3D潜在嵌入。其次,我们提出一种新颖的表征扩散模型,将3D潜在解耦为人脸身份与表情。因此,我们的方法在自监督人脸表征学习模型中,于面部表情识别(FER)和人脸验证上取得最先进性能。相比SOTA方法,我们的模型在RAF-DB上FER准确率提升3.75%,在AffectNet上提升3.35%。
引用
@article{arxiv.2309.08273,
title = {A Generative Framework for Self-Supervised Facial Representation Learning},
author = {Ruian He and Zhen Xing and Weimin Tan and Bo Yan},
journal= {arXiv preprint arXiv:2309.08273},
year = {2024}
}