通过视觉情境提示实现通用目标重识别
计算机视觉与模式识别
2025-09-01 v1 人工智能
摘要
当前目标重识别(ReID)方法训练的是针对特定领域的模型(例如针对人员或车辆),缺乏泛化能力,且对新类别需要高成本的标注数据。虽然自监督学习通过学习实例间不变性来减少标注需求,但在捕获对重识别至关重要的身份敏感特征方面仍受限。本文提出 Visual In-Context Prompting(VICP),一种新型框架,其中在已知类别上训练的模型可直接泛化到仅需\textit{仅通过情境示例}即可处理未知新类别,无需参数调整。VICP 融合了大语言模型(LLM)和视觉基础模型(VFM):LLM 通过任务特定提示从少量正/负配对中推断语义身份规则,进而指导 VFM(如 DINO)通过\textit{动态视觉提示}提取身份判别特征。通过将 LLM 派生的语义概念与 VFM 的预训练先验对齐,VICP 实现了对新类别的泛化,无需针对数据集进行特定化 retraining。为支持评估,我们引入 ShopID10K,一个包含 10K 个对象实例的数据集,来自电子商务平台,具有多视角图像和跨域测试。在 ShopID10K 和多样化 ReID 基准测试中进行的实验表明,VICP 在未知类别上显著优于基线方法。代码已公开于 https://github.com/Hzzone/VICP。
引用
@article{arxiv.2508.21222,
title = {Generalizable Object Re-Identification via Visual In-Context Prompting},
author = {Zhizhong Huang and Xiaoming Liu},
journal= {arXiv preprint arXiv:2508.21222},
year = {2025}
}
备注
ICCV 2025