PaCo-FR:面向人脸表示预训练的 Patch-Pixel 对齐端到端码本学习
计算机视觉与模式识别
2026-04-08 v3
摘要
人脸表示预训练对于人脸识别、表情分析和虚拟现实等任务至关重要。然而,现有方法面临三个关键挑战:(1) 未能捕获人脸特征和细粒度语义,(2) 忽视人脸解剖结构固有的空间结构,(3) 低效利用有限的标注数据。为克服这些问题,我们引入 PaCo-FR,一种无监督框架,结合掩码图像建模与 patch-pixel 对齐。我们的方法集成了三个创新组件:(1) 保持空间一致性的结构化掩码策略,与语义相关的人脸区域对齐,(2) 增强特征区分度的基于 patch 的码本,包含多个候选 token,(3) 保持人脸组成部分几何关系的空间一致性约束。PaCo-FR 仅需 200 万张无标签图像即可实现多个人脸分析任务的状态最佳性能。该方法在不同姿态、遮挡和光照条件下均显著提升,尤其突出。我们认为本工作推动了人脸表示学习,提供了一种可扩展且高效的解决方案,减少对昂贵标注数据集的依赖,推动更有效的人脸分析系统的发展。
引用
@article{arxiv.2508.09691,
title = {PaCo-FR: Patch-Pixel Aligned End-to-End Codebook Learning for Facial Representation Pre-training},
author = {Yin Xie and Zhichao Chen and Zeyu Xiao and Yongle Zhao and Xiang An and Kaicheng Yang and Zimin Ran and Jia Guo and Ziyong Feng and Jiankang Deng},
journal= {arXiv preprint arXiv:2508.09691},
year = {2026}
}