一网打尽:揭示多模态大语言模型在通用行人重识别中的潜力
计算机视觉与模式识别
2025-11-25 v2 人工智能
摘要
行人重识别(ReID)旨在从图像库中检索目标人物的图像,在医疗康复和公共安全等领域有着广泛应用。然而,传统的行人重识别模型通常是单模态的,导致其在异构数据模态上的泛化能力有限。近期,多模态大语言模型(MLLMs)的出现为解决这一问题提供了有前景的途径。尽管有此潜力,现有方法仅将MLLMs视为特征提取器或描述生成器,其在行人重识别任务中的能力在很大程度上尚未被探索。为弥补这一差距,我们引入了一个名为VP-ReID的新型通用行人重识别基准。该基准包含257,310个多模态查询和图库图像,覆盖了十种不同的行人重识别任务。此外,我们为基于MLLM的行人重识别提出了两种面向任务的评估方案。大量实验证明了MLLMs在各种行人重识别任务中令人印象深刻的通用性、有效性和可解释性。然而,它们在处理少数模态,特别是热红外数据时,也存在局限性。我们希望VP-ReID能够促进学界为行人重识别开发更鲁棒、泛化能力更强的跨模态基础模型。
引用
@article{arxiv.2508.06908,
title = {Find Them All: Unveiling MLLMs for Versatile Person Re-identification},
author = {Jinhao Li and Zijian Chen and Lirong Deng and Guangtao Zhai and Changbo Wang},
journal= {arXiv preprint arXiv:2508.06908},
year = {2025}
}