以视觉-语言方式进行的通用人脸表示学习
计算机视觉与模式识别
2022-04-04 v3 计算与语言
摘要
如何学习一种能提升所有人脸分析任务的通用人脸表示?本文向这一目标迈进了一步。在本文中,我们研究了预训练模型在人脸分析任务上的迁移性能,并引入了一个称为 FaRL 的框架,以视觉-语言方式进行通用人脸表示学习(general Facial Representation Learning)。一方面,该框架包含对比损失,从图像-文本对中学习高层语义。另一方面,我们提出同时探索低层信息,通过添加掩码图像建模来进一步增强人脸表示。我们在 LAION-FACE(一个包含大量人脸图像-文本对的数据集)上进行预训练,并在多个下游任务上评估表示能力。我们表明 FaRL 相比以往的预训练模型取得了更好的迁移性能。我们还验证了其在低数据量情形下的优越性。更重要的是,我们的模型在包括人脸解析和人脸对齐在内的人脸分析任务上超越了 SOTA 方法。
引用
@article{arxiv.2112.03109,
title = {General Facial Representation Learning in a Visual-Linguistic Manner},
author = {Yinglin Zheng and Hao Yang and Ting Zhang and Jianmin Bao and Dongdong Chen and Yangyu Huang and Lu Yuan and Dong Chen and Ming Zeng and Fang Wen},
journal= {arXiv preprint arXiv:2112.03109},
year = {2022}
}
备注
CVPR2022 Oral; 16 pages, 6 figures, 14 tables