面向基于文本行人检索的姿态引导多粒度注意力网络
计算机视觉与模式识别
2019-11-28 v3
摘要
基于文本的行人检索旨在借助关于行人的描述语句,从图像数据库中检索出对应的行人图像,这在视频监控等多种应用中具有巨大潜力。提取与人体描述相对应的视觉内容是解决这一跨模态匹配问题的关键。此外,相关的图像与描述涉及不同粒度的语义相关性,而以往方法通常忽略了这一点。为利用多层次对应的视觉内容,我们提出了一种姿态引导多粒度注意力网络(PMA)。首先,我们提出一个粗对齐网络(CA),通过基于相似度的注意力为全局描述筛选相关的图像区域。为进一步捕获与短语相关的视觉身体部位,我们提出一个细粒度对齐网络(FA),其利用姿态信息学习视觉身体部位与文本名词短语之间的潜在语义对齐。为验证模型的有效性,我们在目前唯一的基于文本行人检索可用数据集 CUHK Person Description Dataset (CUHK-PEDES) 上进行了大量实验。实验结果表明,我们的方法在 top-1 指标上比最先进(SOTA)方法高出 15%。
引用
@article{arxiv.1809.08440,
title = {Pose-Guided Multi-Granularity Attention Network for Text-Based Person Search},
author = {Ya Jing and Chenyang Si and Junbo Wang and Wei Wang and Liang Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:1809.08440},
year = {2019}
}
备注
published in AAAI2020(oral)