FRoundation:基石模型是否准备好进行人脸识别?
计算机视觉与模式识别
2025-02-10 v3
摘要
基石模型主要以无监督或自监督方式在高度多样且大规模数据集上进行训练,因而广泛适用于各种下游任务。本文首次探讨此类模型是否适用于特定的人脸识别(FR)领域。我们进一步提出并演示了这些模型在不同数据可用性水平(包括合成数据)上的适配方法。在多个基石模型和规模不同的训练集和微调集上进行大量实验,并在广泛的基准测试上进行评估。我们的结果表明,尽管其灵活性强,预训练的基石模型在FR任务中相对于为该任务专门训练的类似架构仍表现不佳。然而,微调基石模型可获得有前景的结果,常常超过从头训练的模型,尤其是在训练数据有限时。例如,在仅使用1K个身份进行微调后,DINOv2 ViT-S模型在LFW、CALFW、CPLFW、CFP-FP和AgeDB30基准测试上的平均验证准确率达到87.10%,而未进行微调时仅达到64.70%。在相同模型架构ViT-S的情况下,从1k个身份从头训练仅达到69.96%。在获得更大规模FR训练数据集后,这些性能分别提升至DINOv2和CLIP ViT-L模型达到96.03%和95.59%。与为FR从头训练的ViT架构相比,微调后的基石模型在相同架构下实现了相似的性能,同时所需的训练计算成本更低,不依赖于广泛数据可用性的假设。我们进一步演示了合成人脸数据的使用,显示相对于预训练的基石模型和ViT模型,性能得到改善。
引用
@article{arxiv.2410.23831,
title = {FRoundation: Are Foundation Models Ready for Face Recognition?},
author = {Tahar Chettaoui and Naser Damer and Fadi Boutros},
journal= {arXiv preprint arXiv:2410.23831},
year = {2025}
}
备注
Accepted at Image and Vision Computing Journal 2025