中文

评估用于异构人脸识别的多模态大语言模型

计算机视觉与模式识别 2026-01-23 v1

摘要

多模态大语言模型(MLLMs)最近在广泛的视觉-语言任务上展现出了强大的性能,引发了人们对其在生物识别应用中潜在用途的兴趣。在本文中,我们对最先进的 MLLMs 在异构人脸识别(HFR)中的表现进行了系统评估,其中注册图像和探测图像来自不同的传感模态,包括可见光(VIS)、近红外(NIR)、短波红外(SWIR)和热成像相机。我们在多种跨模态场景下对多个开源 MLLMs 进行了基准测试,包括 VIS-NIR、VIS-SWIR 和 VIS-THERMAL 人脸识别。MLLMs 的识别性能使用生物识别协议进行评估,并基于不同的指标,包括采集率、等错误率(EER)和真接受率(TAR)。我们的结果揭示了 MLLMs 与经典人脸识别系统之间存在显著的性能差距,尽管 MLLMs 最近取得了进展,但在具有挑战性的跨光谱条件下尤为明显。我们的发现强调了当前 MLLMs 在 HFR 方面的局限性,以及在考虑将其部署到人脸识别系统中时进行严格生物识别评估的重要性。

关键词

引用

@article{arxiv.2601.15406,
  title  = {Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition},
  author = {Hatef Otroshi Shahreza and Anjith George and Sébastien Marcel},
  journal= {arXiv preprint arXiv:2601.15406},
  year   = {2026}
}