中文

DiCo:面向文本到图像行人重识别的解耦概念表示

计算机视觉与模式识别 2026-02-12 v2

摘要

文本到图像行人重识别 (TIReID) 旨在根据自由形式的文本描述,从大型图像库中检索行人图像。由于视觉外观与文本表达之间存在显著的模态差异,以及需要建模细粒度对应关系以区分具有相似属性(如服装颜色、纹理或着装风格)的个体,TIReID 极具挑战性。为解决这些问题,我们提出了 DiCo(解耦概念表示),一种实现分层且解耦的跨模态对齐的新框架。DiCo 引入了一种基于共享槽位的表示方法,其中每个槽位作为跨模态的部件级锚点,并进一步分解为多个概念块。这种设计能够在保持图像与文本之间一致的部件级对应的同时,解耦互补属性(例如颜色、纹理、形状)。在 CUHK-PEDES、ICFG-PEDES 和 RSTPReid 上的大量实验表明,我们的框架取得了与最先进方法相当的性能,同时通过显式的槽位和块级表示增强了可解释性,从而获得更细粒度的检索结果。

关键词

引用

@article{arxiv.2601.10053,
  title  = {DiCo: Disentangled Concept Representation for Text-to-image Person Re-identification},
  author = {Giyeol Kim and Chanho Eom},
  journal= {arXiv preprint arXiv:2601.10053},
  year   = {2026}
}