中文

利用更丰富的自身信息学习全面表征的文本到图像行人重识别

计算机视觉与模式识别 2023-10-18 v1 多媒体

摘要

文本到图像行人重识别(TIReID)基于查询文本检索同一身份的行人图像。然而,现有的 TIReID 方法通常将其视为一对一的图像-文本匹配问题,仅关注同一视角内图像-文本对之间的关系,未考虑同一身份下跨视角的图像-文本对之间的多对多匹配,这是现有方法性能不佳的主要原因之一。为此,我们提出了一个简单而有效的框架 LCR2^2S,通过从新视角为两种模态学习全面表征来建模同一身份的多对多对应。我们为每幅图像(文本)利用同一身份下的其他图像(文本)构建支持集,并设计多头注意力融合模块来融合图像(文本)及其支持集。得到的增强图像和文本特征融合了多视角信息,并将其对齐以训练具有多对多对应关系的“更丰富”的 TIReID 模型。由于推理时支持集不可用,我们提出将“更丰富”模型学到的知识蒸馏到一个轻量级模型中,以单幅图像/文本作为输入进行推理。轻量级模型关注多视角信息的语义关联与推理,仅以单视角输入即可生成包含多视角信息的全面表征,从而在推理时执行准确的文本到图像检索。特别地,我们利用“更丰富”模型的模态内特征和模态间语义关系来监督轻量级模型继承其强大能力。大量实验证明了 LCR2^2S 的有效性,并且它在三个流行的 TIReID 数据集上取得了新的 SOTA 性能。

关键词

引用

@article{arxiv.2310.11210,
  title  = {Learning Comprehensive Representations with Richer Self for Text-to-Image Person Re-Identification},
  author = {Shuanglin Yan and Neng Dong and Jun Liu and Liyan Zhang and Jinhui Tang},
  journal= {arXiv preprint arXiv:2310.11210},
  year   = {2023}
}

备注

Accepted by ACM MM 2023