面向指纹分析的多模态大语言模型综合基准FPBench
计算机视觉与模式识别
2026-04-14 v2
摘要
多模态大语言模型(MLLMs)能够执行复杂的数据分析、视觉问答、生成和推理任务。然而, 其分析生物识别数据的能力相对不被探索。本文研究了MLLMs理解指纹图像中细粒结构和纹理细节的能力。为此, 我们设计了综合性基准FPBench, 以评估20个MLLMs(开源和专有模型)在7个真实和合成数据集上的8项生物识别和 Forensic 任务(如模式分析、指纹验证、真实与合成分类等)的表现, 使用零shot和链式思考提示策略。我们进一步对部分开源MLLMs进行微调, 以演示领域适应。FPBench是一个旨在作为发展指纹基石模型的第一步设计的新型基准。我们的发现表明, 对视觉和语言编码器进行微调可使性能提升7%-39%。我们的代码已公开于https://github.com/Ektagavas/FPBench。
引用
@article{arxiv.2512.18073,
title = {FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis},
author = {Ekta Gavas and Sudipta Banerjee and Chinmay Hegde and Nasir Memon},
journal= {arXiv preprint arXiv:2512.18073},
year = {2026}
}
备注
Revised version with additional experiments and code release