中文

用于无监督多情景人体重识别的图像-文本知识建模

计算机视觉与模式识别 2026-01-19 v1

摘要

我们提出了无监督多情景人体重识别(ReID)作为一个新的任务,将 ReID 跨越多样化情景(如跨分辨率、衣物变化等)在单个连贯框架内扩展。为解决 UMS-ReID,我们引入了图像-文本知识建模(ITKM)——一个三阶段框架,有效利用视觉-语言模型的表征能力。在阶段 I,我们在预训练的 CLIP 模型中引入场景嵌入,并微调编码器以适应性地利用来自多个情景的知识。在阶段 II,我们优化一组学习文本嵌入,以与阶段 I 的伪标签相关联,并引入多情景分离损失以增加情景间文本表征的离散度。在阶段 III,我们首先引入聚类级和实例级的异构匹配模块,以在每个情景中获取可靠的异构正负样本对(例如,可见图像和红外图像中同一人的图像)。接着,我们提出了动态文本表示更新策略,以维持文本和图像监督信号之间的一致性。跨多个情景的实验结果表明,ITKM 在有效性和通用性方面均优于现有的情景特定方法,还通过整合来自多个情景的知识而提升了整体性能。

关键词

引用

@article{arxiv.2601.11243,
  title  = {Image-Text Knowledge Modeling for Unsupervised Multi-Scenario Person Re-Identification},
  author = {Zhiqi Pang and Lingling Zhao and Yang Liu and Chunyu Wang and Gaurav Sharma},
  journal= {arXiv preprint arXiv:2601.11243},
  year   = {2026}
}

备注

12 pages, 10 figures