跨模态自适应双关联用于文本到图像行人检索
计算机视觉与模式识别
2023-12-05 v1
摘要
文本到图像的行人重识别(ReID)旨在根据给定的文本描述检索行人图像。关键挑战在于学习视觉和文本模态之间详细信息的关联。现有工作侧重于学习潜在空间以缩小模态差距,并进一步构建两种模态之间的局部对应关系。然而,这些方法假设图像到文本和文本到图像的关联是模态无关的,导致关联次优。在这项工作中,我们展示了图像到文本关联与文本到图像关联之间的差异,并提出了CADA:跨模态自适应双关联,精细地构建双向图像-文本详细关联。我们的方法采用基于解码器的自适应双关联模块,实现视觉和文本模态之间的完全交互,允许双向和自适应的跨模态对应关联。具体来说,本文提出了一种双向关联机制:文本标记到图像块的关联(ATP)和图像区域到文本属性的关联(ARA)。我们基于错误关联聚合跨模态特征会导致特征失真这一事实,自适应地建模ATP。对于ARA的建模,由于属性通常是行人的首要区分线索,我们提出通过使用相关图像区域预测掩码文本短语来探索属性级关联。最后,我们学习文本和图像之间的双关联,实验结果证明了我们双关联公式的优越性。代码将公开提供。
引用
@article{arxiv.2312.01745,
title = {Cross-Modal Adaptive Dual Association for Text-to-Image Person Retrieval},
author = {Dixuan Lin and Yixing Peng and Jingke Meng and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2312.01745},
year = {2023}
}