VGSG:面向基于文本行人检索的视觉引导语义分组网络
计算机视觉与模式识别
2023-11-14 v1
摘要
基于文本的行人检索(TBPS)旨在根据文本描述检索目标行人的图像。对 TBPS 而言,提取细粒度局部特征并跨模态对齐至关重要。现有方法利用外部工具或繁重的跨模态交互来实现跨模态细粒度特征的显式对齐,效率低且耗时。本工作中,我们提出一种视觉引导语义分组网络(VGSG)用于基于文本的行人检索,以提取对齐良好的细粒度视觉与文本特征。在所提 VGSG 中,我们开发了语义分组文本学习(SGTL)模块与视觉引导知识迁移(VGKT)模块,以在视觉局部线索引导下提取文本局部特征。在 SGTL 中,为获得局部文本表示,我们基于语言表达的语义线索从通道维度对文本特征分组,从而无需外部工具即可隐式地将相似语义模式分组。在 VGKT 中,采用视觉引导注意力提取与视觉线索固有对齐、称为视觉引导文本特征的视觉相关文本特征。此外,我们设计了一种关系知识迁移,包含视觉-语言相似度迁移与类概率迁移,以自适应地将视觉引导文本特征的信息传播至语义分组文本特征。借助关系知识迁移,VGKT 能够无需外部工具与复杂成对交互即可将语义分组文本特征与相应视觉特征对齐。在两个具挑战性基准上的实验结果证明了其相对于最先进方法的优越性。
引用
@article{arxiv.2311.07514,
title = {VGSG: Vision-Guided Semantic-Group Network for Text-based Person Search},
author = {Shuting He and Hao Luo and Wei Jiang and Xudong Jiang and Henghui Ding},
journal= {arXiv preprint arXiv:2311.07514},
year = {2023}
}
备注
Accepted to IEEE TIP