基于文本行人检索的非对称跨尺度对齐
计算机视觉与模式识别
2022-12-23 v1 网络与互联网体系结构
摘要
基于文本的行人检索(TBPS)在智能监控中具有重要意义,旨在检索与给定文本描述具有高度语义相关性的行人图像。该检索任务兼具模态异质性和细粒度匹配的特点。为实现此任务,需要从图像和文本域提取多尺度特征,再进行跨模态对齐。然而,大多数现有方法仅考虑各自尺度内的对齐,例如图像-句子或区域-短语尺度。这种策略在特征提取中采用了预设的对齐,而忽略了跨尺度对齐,例如图像-短语。本文提出一种基于 transformer 的模型来提取多尺度表示,并施行非对称跨尺度对齐(ACSA)以精确对齐两种模态。具体而言,ACSA 由全局级对齐模块和非对称交叉注意力模块组成,前者在全局尺度上对齐图像与文本,后者应用交叉注意力机制动态对齐区域/图像-短语尺度下的跨模态实体。在 CUHK-PEDES 和 RSTPReid 两个基准数据集上的大量实验证明了我们方法的有效性。代码见 \href{url}{https://github.com/mul-hjh/ACSA}。
引用
@article{arxiv.2212.11958,
title = {Asymmetric Cross-Scale Alignment for Text-Based Person Search},
author = {Zhong Ji and Junhua Hu and Deyin Liu and Lin Yuanbo Wu and Ye zhao},
journal= {arXiv preprint arXiv:2212.11958},
year = {2022}
}
备注
Accepted by IEEE Transactions on Multimedia