中文

面向人脸识别的多模态大语言模型基准测试

计算机视觉与模式识别 2025-10-17 v1 人工智能 计算与语言

摘要

多模态大语言模型(MLLM)在 diverse vision-and-language 任务上取得了显著的性能,但在人脸识别领域的潜力仍未得到充分探索。特别是,开源 MLLM 的性能在标准基准测试上需要与现有人脸识别模型进行评估比较。本文我们在多个人脸识别数据集上,对 state-of-the-art MLLM 进行系统性基准测试,包括 LFW、CALFW、CPLFW、CFP、AgeDB 和 RFW。实验结果表明,尽管 MLLM 捕获了对人脸相关任务有用的丰富语义线索,但在零样本应用中,仍落后于专用模型在高精度识别场景中的表现。本基准测试为推动 MLLM 基于人脸识别的发展提供了基础,为设计更高精度和更广泛泛化的模型提供了洞见。我们的基准测试源码已公开于项目页面。

关键词

引用

@article{arxiv.2510.14866,
  title  = {Benchmarking Multimodal Large Language Models for Face Recognition},
  author = {Hatef Otroshi Shahreza and Sébastien Marcel},
  journal= {arXiv preprint arXiv:2510.14866},
  year   = {2025}
}