中文

用于基于图像和文本的行人重识别的层次化提示学习

计算机视觉与模式识别 2025-11-18 v1 人工智能

摘要

行人重识别(ReID)旨在根据视觉查询(图像到图像,I2I)或文本描述(文本到图像,T2I)检索目标行人图像。尽管这两个任务共享一个共同的检索目标,但它们提出了不同的挑战:I2I 强调判别性身份学习,而 T2I 需要精确的跨模态语义对齐。现有方法通常分别处理这些任务,这可能导致表示纠缠和次优性能。为了解决这个问题,我们提出了一个名为层次化提示学习(HPL)的统一框架,该框架利用任务感知的提示建模来联合优化这两个任务。具体来说,我们首先引入了一个任务路由 Transformer,它将双分类标记整合到一个共享的视觉编码器中,以分别路由 I2I 和 T2I 分支的特征。在此基础上,我们开发了一种层次化提示生成方案,该方案将身份级可学习标记与实例级伪文本标记相结合。这些伪标记通过模态特定的反演网络从图像或文本特征中导出,将细粒度的、实例特定的语义注入到提示中。此外,我们提出了一种跨模态提示正则化策略,以在提示标记空间中强制实现语义对齐,确保伪提示在保留源模态特征的同时增强跨模态可迁移性。在多个 ReID 基准上的大量实验验证了我们方法的有效性,在 I2I 和 T2I 任务上均取得了最先进的性能。

关键词

引用

@article{arxiv.2511.13575,
  title  = {Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification},
  author = {Linhan Zhou and Shuang Li and Neng Dong and Yonghang Tai and Yafei Zhang and Huafeng Li},
  journal= {arXiv preprint arXiv:2511.13575},
  year   = {2025}
}

备注

9 pages, 4 figures, accepted by AAAI 2026