CLIP-HandID:面向基于手部的人体识别的视觉语言模型
计算机视觉与模式识别
2025-07-31 v3
摘要
本文提出一种基于手部图像的人体识别新方法,专门用于刑事侦查。该方法在性虐待等严重犯罪中尤其有价值,因为手部图像往往是唯一可用的可识别证据。我们提出的方法 CLIP-HandID 利用预训练的基础视觉语言模型 CLIP,通过文本提示作为语义引导,高效地从手部图像(输入至 CLIP 的图像编码器)中学习判别性的深度特征表示。由于手部图像以索引而非文本描述标注,我们采用文本反转网络学习伪标记,以编码特定的视觉上下文或外观属性。这些学习到的伪标记随后被纳入文本提示中,输入 CLIP 的文本编码器以利用其多模态推理能力并增强识别的泛化能力。通过在两个具有多族裔代表性的大型公开手部数据集上的广泛评估,我们证明该方法显著优于现有方法。
引用
@article{arxiv.2506.12447,
title = {CLIP-HandID: Vision-Language Model for Hand-Based Person Identification},
author = {Nathanael L. Baisa and Babu Pallam and Amudhavel Jayavel},
journal= {arXiv preprint arXiv:2506.12447},
year = {2025}
}