面向通用指令引导的人员重识别:Instruct-ReID++
计算机视觉与模式识别
2025-04-30 v2
摘要
人类智能能够根据视觉和语言描述检索任何人。然而,当前计算机视觉社区在不同场景下分别研究特定的人员重识别(person re-identification, ReID)任务,这限制了其在现实世界中的应用。本文通过提出一种新颖的指令引导 ReID 任务(instruct-ReID),该任务要求模型根据给定的图像或语言指令检索图像,来解决上述问题。Instruct-ReID 是一种通用 ReID 设置的首次探索,其中现有的 6 种 ReID 任务可视为通过赋予不同指令而呈现为特殊情况。为促进该新指令 ReID 任务的研究,我们提出了大规模 OmniReID++ 基准数据集,配备多样化数据和全面的评估方法,如任务特定和任务无关的评估设置。在任务特定的评估设置中,将将根据特定 ReID 任务对 gallery 集合进行分类。我们提出了一种新的基线模型 IRM,采用自适应三角损失(adaptive triplet loss)以统一框架处理各种检索任务。对于任务无关的评估设置,其中目标人员图像从任务无关的 gallery 集合中检索,我们进一步提出了一种名为 IRM++ 的新方法,采用 novel memory bank-assisted learning。对 IRM 和 IRM++ 在 OmniReID++ 基准上的广泛评估表明,我们所提出的方法具有优势,在 10 个测试集上实现了最先进的性能。该数据集、模型和代码将在 https://github.com/hwz-zju/Instruct-ReID 上提供。
关键词
引用
@article{arxiv.2405.17790,
title = {Instruct-ReID++: Towards Universal Purpose Instruction-Guided Person Re-identification},
author = {Weizhen He and Yiheng Deng and Yunfeng Yan and Feng Zhu and Yizhou Wang and Lei Bai and Qingsong Xie and Donglian Qi and Wanli Ouyang and Shixiang Tang},
journal= {arXiv preprint arXiv:2405.17790},
year = {2025}
}
备注
arXiv admin note: substantial text overlap with arXiv:2306.07520