中文

IIITD-20K:面向文本-图像行人重识别的密集描述数据集

计算机视觉与模式识别 2023-05-09 v1 多媒体

摘要

文本到图像(T2I)行人重识别(ReID)近年来备受关注。CUHK-PEDES、RSTPReid 和 ICFG-PEDES 是评估 T2I ReID 方法的三个可用基准。RSTPReid 和 ICFG-PEDES 包含来自 MSMT17 的身份,但由于唯一人物数量有限,多样性受限。另一方面,CUHK-PEDES 包含 13,003 个身份,但平均文本描述相对较短。此外,这些数据集均在受限环境中以有限数量的摄像头采集。为了进一步丰富身份多样性并提供密集描述,我们提出了一个名为 IIITD-20K 的新数据集。IIITD-20K 包含 20,000 个在真实场景中采集的唯一身份,为文本到图像 ReID 提供了丰富的数据集。每幅图像均经密集描述,描述至少 26 个词。我们进一步利用在本文数据集上训练的 Stable-diffusion 和 BLIP 模型合成生成图像与细粒度描述。我们使用最先进的文本到图像 ReID 模型和视觉-语言预训练模型进行了详尽实验,并对数据集进行了全面分析。实验还表明,合成生成的数据在同数据集及跨数据集设定下均能带来显著的性能提升。我们的数据集可在 https://bit.ly/3pkA3Rj 获取。

关键词

引用

@article{arxiv.2305.04497,
  title  = {IIITD-20K: Dense captioning for Text-Image ReID},
  author = {A V Subramanyam and Niranjan Sundararajan and Vibhu Dubey and Brejesh Lall},
  journal= {arXiv preprint arXiv:2305.04497},
  year   = {2023}
}