基础模型与领域特定模型:面容识别中的性能比较、融合与可解释性
计算机视觉与模式识别
2025-08-12 v2 人工智能
摘要
本文我们围绕以下问题展开研究:通用基础模型(如CLIP、BLIP、GPT-4o、Grok-4)在面容识别任务中如何与领域特定面容识别模型(即AdaFace或ArcFace)进行比较?通过一系列涉及多个基础模型和基准数据集的实验,我们报告了以下发现:(a) 在所有面容基准数据集中,领域特定模型在零样本基础模型上取得了更好的性能。(b) 零样本通用基础模型的性能在过度分割的面容图像上优于严格裁剪的面容图像,从而表明语境线索的重要性。(c) 将基础模型与领域特定面容识别模型进行简单得分水平的融合可在低错误匹配率下提高准确率。(d) 基础模型如GPT-4o和Grok-4能够为面容识别管道提供可解释性。在某些情况下,基础模型甚至能够解决AdaFace所做出的低置信度决策,从而重新强调了以明智的方式将领域特定面容识别模型与通用基础模型结合的重要性。
引用
@article{arxiv.2507.03541,
title = {Foundation versus Domain-specific Models: Performance Comparison, Fusion, and Explainability in Face Recognition},
author = {Redwan Sony and Parisa Farmanifard and Arun Ross and Anil K. Jain},
journal= {arXiv preprint arXiv:2507.03541},
year = {2025}
}
备注
Accepted at the International Conference on Computer Vision (ICCV) 2025 Workshop