GPTFace:基于跨度遮盖和弱相关文本图像数据的面部语言 Transformer 生成预训练
计算机视觉与模式识别
2025-10-22 v1
摘要
与自然图像理解中预训练模型的繁荣发展相比,面部知识学习的大规模预训练模型研究仍有限。当前方法主要依赖手动组装和标注的人脸数据集进行训练,但标注此类数据集需要大量劳动力,而且训练得到的模型在训练数据之外的可扩展性有限。为此,我们提出一种面向面部知识学习的生成式预训练模型,利用大规模网络爬取数据进行训练。我们使用来自互联网爬取的包含人脸的文本和图像数据,并在包括遮盖图像/语言建模 (MILM) 和图像文本匹配 (ITM) 的自监督任务上进行预训练。在生成阶段,我们进一步利用图像文本匹配损失将生成分布拉向控制信号,以实现可控图像/文本生成。实验结果表明,我们的模型在各种面部下游任务上(如属性分类和情绪识别)的性能与最先进的预训练模型相当。此外,我们的方法也适用于广泛的人脸编辑任务,包括人脸属性编辑、情绪操控、口罩移除和照片填充。
引用
@article{arxiv.2510.18345,
title = {GPTFace: Generative Pre-training of Facial-Linguistic Transformer by Span Masking and Weakly Correlated Text-image Data},
author = {Yudong Li and Hao Li and Xianxu Hou and Linlin Shen},
journal= {arXiv preprint arXiv:2510.18345},
year = {2025}
}
备注
This work was initially drafted in November 2022