中文

LVFace:大规模视觉模型中基于分层聚类优化的人脸识别

计算机视觉与模式识别 2025-08-18 v3

摘要

视觉Transformer (ViT) 已彻底革新了大规模视觉建模,但在人脸识别 (FR) 领域仍鲜有探索,因为卷积神经网络 (CNN) 仍占据主导地位。我们识别出关键瓶颈:受CNN驱动的训练范式未能发掘ViT的潜力,导致性能次优和收敛不稳定。为解决此挑战,我们提出LVFace,一种基于ViT的人脸识别模型,集成分层聚类优化 (PCO) 以实现卓越成果。具体而言,PCO依次应用负类抽样 (NCS) 实现从随机初始化开始的稳健且快速的特征对齐,通过特征期望惩罚实现质心稳定,通过无NCS约束的全批次训练进行聚类边界细化。LVFace建立了新的人脸识别基线,超越UniFace和TopoFR等领先方法,在多个基准测试中表现卓越。大量实验表明,LVFace持续 delivers 性能提升,同时在大规模数据集上表现出良好的可扩展性,兼容主流视觉语言模型和大语言模型。值得注意的是,LVFace在ICCV 2021遮蔽人脸识别 (MFR) 持续挑战赛中夺得冠军 (2025年3月),证明其在实际场景中的有效性。项目已开源于 https://github.com/bytedance/LVFace。

关键词

引用

@article{arxiv.2501.13420,
  title  = {LVFace: Progressive Cluster Optimization for Large Vision Models in Face Recognition},
  author = {Jinghan You and Shanglin Li and Yuanrui Sun and Jiangchuan Wei and Mingyu Guo and Chao Feng and Jiao Ran},
  journal= {arXiv preprint arXiv:2501.13420},
  year   = {2025}
}

备注

Accepted at ICCV25 as highlight paper, code released at https://github.com/bytedance/LVFace