用于文本到图像部件感知行人重识别的语义自对齐网络
计算机视觉与模式识别
2021-08-10 v2
摘要
文本到图像行人重识别(ReID)旨在利用文本描述检索包含目标行人的图像。然而,由于显著的模态鸿沟以及文本描述中较大的类内差异,文本到图像ReID仍是一个具有挑战性的问题。为此,本文提出一种语义自对齐网络(SSAN)以应对上述问题。首先,我们提出一种新方法,自动从两种模态中提取语义对齐的部件级特征。其次,我们设计了一个多视角非局部网络,捕捉身体部位之间的关系,从而建立身体部位与名词短语之间更好的对应。第三,我们引入一种复合排序(CR)损失,利用同一身份其他图像的文本描述提供额外监督,从而有效减小文本特征中的类内差异。最后,为推进文本到图像ReID的未来研究,我们构建了一个名为ICFG-PEDES的新数据库。大量实验表明SSAN以显著优势超越最先进的方法。新的ICFG-PEDES数据库与SSAN代码均可在 https://github.com/zifyloo/SSAN 获取。
引用
@article{arxiv.2107.12666,
title = {Semantically Self-Aligned Network for Text-to-Image Part-aware Person Re-identification},
author = {Zefeng Ding and Changxing Ding and Zhiyin Shao and Dacheng Tao},
journal= {arXiv preprint arXiv:2107.12666},
year = {2021}
}
备注
A new database for text-to-image ReID is provided. Code will be released