中文

面向文本到图像行人重识别的粒度统一表示学习

计算机视觉与模式识别 2022-07-19 v1

摘要

文本到图像行人重识别(ReID)旨在通过对文本描述的查询来搜索感兴趣身份的行人图像。由于丰富的模态内差异与显著的模态间鸿沟,该任务极具挑战性。现有工作通常忽略两模态间特征粒度的差异,即视觉特征通常细粒度而文本特征粗粒度,这被认为是造成较大模态间鸿沟的主因。本文中,我们提出一种基于 transformer 的端到端框架来为两模态学习粒度统一表示,记为 LGUR。LGUR 框架包含两个模块:基于字典的粒度对齐(DGA)模块与基于原型的粒度统一(PGU)模块。在 DGA 中,为对齐两模态粒度,我们引入多模态共享字典(MSD)来重构视觉与文本特征。此外,DGA 具有两个重要因素,即跨模态引导与以前景为中心的重构,以促进 MSD 的优化。在 PGU 中,我们采用一组共享且可学习的原型作为查询,在粒度统一特征空间中为两模态提取多样且语义对齐的特征,从而进一步提升 ReID 性能。综合实验表明,我们的 LGUR 在 CUHK-PEDES 与 ICFG-PEDES 数据集上均以大幅优势持续超越 SOTA 方法。代码将发布于 https://github.com/ZhiyinShao-H/LGUR。

关键词

引用

@article{arxiv.2207.07802,
  title  = {Learning Granularity-Unified Representations for Text-to-Image Person Re-identification},
  author = {Zhiyin Shao and Xinyu Zhang and Meng Fang and Zhifeng Lin and Jian Wang and Changxing Ding},
  journal= {arXiv preprint arXiv:2207.07802},
  year   = {2022}
}

备注

Accepted by ACM Multimedia 2022