中文

通过多粒度图像-文本对齐改进基于描述的人员重识别

计算机视觉与模式识别 2019-06-25 v1

摘要

基于描述的人员重识别(Re-id)是视频监控中的一项重要任务,需要判别性的跨模态表示以区分不同行人。由于模态异质性(跨模态问题),直接度量图像与描述之间的相似度十分困难。且所有样本均属单一类别(细粒度问题)使得该任务比常规的图像-描述匹配任务更难。本文提出多粒度图像-文本对齐(MIA)模型,以缓解基于描述的人员Re-id中的跨模态细粒度问题,从而实现更好的相似度评估。具体地,分层地执行三种不同粒度,即全局-全局、全局-局部与局部-局部对齐。首先,全局对比(GC)模块中的全局-全局对齐用于匹配图像与描述的全局上下文。其次,全局-局部对齐在关系引导的全局-局部对齐(RGA)模块中利用局部成分与全局上下文之间的潜在关系,自适应地突出可区分成分并消除无关成分。第三,对于局部-局部对齐,我们在双向细粒度匹配(BFM)模块中将视觉人体部位与名词短语相匹配。整合多粒度的整体网络可端到端训练,无需复杂预处理。为解决多粒度组合的训练困难,提出一种有效的分步训练策略逐步训练这些粒度。大量实验与分析表明,我们的方法在CUHK-PEDES数据集上取得了最先进的性能,并大幅优于以往方法。

关键词

引用

@article{arxiv.1906.09610,
  title  = {Improving Description-based Person Re-identification by Multi-granularity Image-text Alignments},
  author = {Kai Niu and Yan Huang and Wanli Ouyang and Liang Wang},
  journal= {arXiv preprint arXiv:1906.09610},
  year   = {2019}
}