中文

通用多模态 LLM 通过人类显著性获得生物识别专长

计算机视觉与模式识别 2026-03-19 v1 人工智能

摘要

虽然虹膜展示攻击检测 (PAD) 对安全生物识别部署至关重要,但开发专业模型面临诸多实际障碍:不可能收集代表未来未知攻击的数据,且收集足够多样的数据仍受限于其预测能力,且成本高昂。此外,分享生物识别数据也引发隐私顾虑。鉴于新攻击向量快速涌现,对适应性解决方案的需求日益迫切,我们因此本文调查是否可以通过将人类专家知识注入到通用多模态大语言模型 (MLLM) 中,使其在严格的隐私约束下(即禁止将生物识别数据发送到公共云 MLLM 服务)执行虹膜 PAD。通过对视觉编码器嵌入进行分析,我们展示了预训练的视觉 Transformer 在 MLLM 中本质上会聚类许多虹膜攻击类型,尽管从未为此任务进行过显式训练。然而,在攻击类别之间显示出重叠的地方,我们发现,结构化提示(包含来自主体识别攻击指示标志的语言描述)使这些模型能够解决歧义。我们在由 IRB 限制的 224 张虹膜图像数据集(涵盖七种攻击类型)上进行测试,仅使用大学批准的服务(如 Gemini 2.5 Pro)或本地托管模型(如 Llama 3.2-Vision),我们展示了 Gemini 带有专家信息提示的模型超越了基于卷积神经网络 (CNN) 的专业基准以及人类评估员,而本地可部署的 Llama 实现了接近人类的性能。我们的结果表明,在隐私约束下可部署的 MLLM 为虹膜 PAD 提供了可行的路径。

关键词

引用

@article{arxiv.2603.17173,
  title  = {Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience},
  author = {Jacob Piland and Byron Dowling and Christopher Sweet and Adam Czajka},
  journal= {arXiv preprint arXiv:2603.17173},
  year   = {2026}
}