用于基于文本行人重识别的带最大门控块双路CNN
计算机视觉与模式识别
2020-09-22 v1
摘要
基于文本的行人重识别(Re-id)是视频监控中的一项重要任务,其目标是从大规模图像库中根据文本描述检索出对应行人的图像。由于模态异质性,直接匹配视觉内容与文本描述十分困难。一方面,文本嵌入因文本描述的高度抽象性而判别力不足;另一方面,全局平均池化(GAP)常用于隐式提取更通用或平滑的特征,却忽略了对于跨模态匹配问题更为重要的显著局部特征。鉴于此,本文提出一种新颖的带最大门控块的双路CNN(DCMG),以提取判别性词嵌入并使视觉-文本关联更关注两模态的显著特征。所提框架基于两个深度残差CNN,通过跨模态投影匹配(CMPM)损失与跨模态投影分类(CMPC)损失联合优化,将两模态嵌入至联合特征空间。首先,预训练语言模型BERT与卷积神经网络(CNN)结合,以在文本到图像匹配领域学习更好的词嵌入。其次,应用全局最大池化(GMP)层使视觉-文本特征更聚焦于显著部分。为进一步缓解最大池化特征的噪声,提出门控块(GB)以生成关注两模态有意义特征的注意力图。最后,在基准数据集CUHK-PEDES上进行了充分实验,本文方法取得55.81%的rank-1准确率,并以1.3%的优势超越最先进(SOTA)方法。
引用
@article{arxiv.2009.09343,
title = {Dual-path CNN with Max Gated block for Text-Based Person Re-identification},
author = {Tinghuai Ma and Mingming Yang and Huan Rong and Yurong Qian and Yurong Qian and Yuan Tian and NajlaAl-Nabhan},
journal= {arXiv preprint arXiv:2009.09343},
year = {2020}
}