中文

见微知著:基于文本的行人检索中的隐式模态对齐

计算机视觉与模式识别 2022-08-29 v2

摘要

基于文本的行人检索旨在根据文本描述查找查询行人。关键在于学习视觉与文本模态之间的公共潜在空间映射。为实现该目标,现有工作采用分割获得显式跨模态对齐,或利用注意力探索显著对齐。这些方法有两个缺点:1)标注跨模态对齐耗时;2)注意力方法能探索显著跨模态对齐但可能忽略一些细微而有价值的配对。为缓解这些问题,我们引入一种用于基于文本行人检索的隐式视觉-文本(IVT)框架。与先前模型不同,IVT 利用单一网络学习两种模态的表示,有助于视觉-文本交互。为探索细粒度对齐,我们进一步提出两种隐式语义对齐范式:多级对齐(MLA)与双向掩码建模(BMM)。MLA 模块在句子、短语和词级别探索更精细匹配,而 BMM 模块旨在挖掘视觉与文本模态间更多语义对齐。我们在公开数据集 CUHK-PEDES、RSTPReID 和 ICFG-PEDES 上进行了大量实验评估所提 IVT。即使无显式身体部位对齐,我们的方法仍取得了最先进的性能。代码见:https://github.com/TencentYoutuResearch/PersonRetrieval-IVT。

关键词

引用

@article{arxiv.2208.08608,
  title  = {See Finer, See More: Implicit Modality Alignment for Text-based Person Retrieval},
  author = {Xiujun Shu and Wei Wen and Haoqian Wu and Keyu Chen and Yiran Song and Ruizhi Qiao and Bo Ren and Xiao Wang},
  journal= {arXiv preprint arXiv:2208.08608},
  year   = {2022}
}

备注

Accepted at ECCV Workshop on Real-World Surveillance (RWS 2022)