中文

ReID 的演进:从早期方法到大型语言模型集成

计算机视觉与模式识别 2025-06-17 v1

摘要

人员再识别(ReID)已从手工特征方法演进到深度学习方法,最近又发展到融入大型语言模型(LLM)的模型。早期方法在光照、姿态和视角变化方面存在困难,但深度学习通过学习鲁棒的视觉特征解决了这些问题。在此基础上,LLM 现在使 ReID 系统能够通过自然语言整合语义和上下文信息。本综述追踪了这一完整演进,并提供了首批对利用 LLM 的 ReID 方法的全面综述之一,其中文本描述被用作特权信息以改进视觉匹配。关键贡献之一是使用由 GPT-4o 生成的动态、身份特定提示,这些提示增强了视觉-语言 ReID 系统中图像与文本的对齐。实验结果表明这些描述提升了准确性,尤其是在复杂或模糊的情况下。为了支持进一步研究,我们发布了一套大量用于标准 ReID 数据集的 GPT-4o 生成描述。通过连接计算机视觉和自然语言处理,本综述为该领域的发展提供了统一的视角,并概述了关键的未来方向,如更好的提示设计、跨模态迁移学习和现实适应性。

关键词

引用

@article{arxiv.2506.13039,
  title  = {Evolution of ReID: From Early Methods to LLM Integration},
  author = {Amran Bhuiyan and Mizanur Rahman and Md Tahmid Rahman Laskar and Aijun An and Jimmy Xiangji Huang},
  journal= {arXiv preprint arXiv:2506.13039},
  year   = {2025}
}