中文

Instruct-ReID:一种带指令的多用途行人重识别任务

计算机视觉与模式识别 2025-04-30 v5

摘要

人类智能能够根据视觉和语言描述检索任意行人。然而,当前计算机视觉界在不同场景下分别研究特定的行人重识别(ReID)任务,这限制了在现实世界中的应用。本文致力于通过提出一种新的 instruct-ReID 任务来解决该问题,该任务要求模型根据给定的图像或语言指令检索图像。我们的 instruct-ReID 是一种更通用的 ReID 设定,现有的 6 种 ReID 任务可通过设计不同指令视为其特例。我们提出了一个大规模 OmniReID 基准和一个自适应三元组损失作为基线方法,以推动这一新设定下的研究。实验结果表明,所提出的多用途 ReID 模型在 OmniReID 基准上训练且无需微调,在传统 ReID 的 Market1501、MSMT17、CUHK03 上 mAP 分别提升 +0.5%、+0.6%、+7.7%,在换衣 ReID 的 PRCC、VC-Clothes、LTCC 上提升 +6.4%、+7.1%、+11.2%,在仅使用 RGB 图像基于衣服模板的换衣 ReID 的 COCAS+ real2 上提升 +11.7%,在我们新定义的语言指令 ReID 的 COCAS+ real2 上提升 +24.9%,在可见光-红外 ReID 的 LLCM 上提升 +4.3%,在文本到图像 ReID 的 CUHK-PEDES 上提升 +2.6%。数据集、模型和代码将发布于 https://github.com/hwz-zju/Instruct-ReID。

关键词

引用

@article{arxiv.2306.07520,
  title  = {Instruct-ReID: A Multi-purpose Person Re-identification Task with Instructions},
  author = {Weizhen He and Yiheng Deng and Shixiang Tang and Qihao Chen and Qingsong Xie and Yizhou Wang and Lei Bai and Feng Zhu and Rui Zhao and Wanli Ouyang and Donglian Qi and Yunfeng Yan},
  journal= {arXiv preprint arXiv:2306.07520},
  year   = {2025}
}