通过全局与局部图文关联改进面向行人重识别的深度视觉表征
计算机视觉与模式识别
2018-08-07 v1
摘要
行人重识别是一项重要任务,需要学习具有判别力的视觉特征以区分不同行人身份。多种辅助信息已被用于改进视觉特征学习。本文中,我们提出利用自然语言描述作为额外训练监督以学习有效视觉特征。与其他辅助信息相比,语言能从更紧凑和语义化的视觉方面描述特定行人,因而与像素级图像数据互补。我们的方法不仅利用整体描述的监督学习更好的全局视觉特征,还通过对齐局部视觉与语言特征之间的语义一致性(这通过构建全局与局部图文关联实现)。全局图文关联根据身份标签建立,而局部关联基于图像区域与名词短语之间的隐式对应。大量实验证明了利用语言作为训练监督并结合两种关联方案的有效性。我们的方法在测试时不使用任何辅助信息的情况下达到了最先进性能,并表现出优于其他用于图文关联的联合嵌入方法。
引用
@article{arxiv.1808.01571,
title = {Improving Deep Visual Representation for Person Re-identification by Global and Local Image-language Association},
author = {Dapeng Chen and Hongsheng Li and Xihui Liu and Yantao Shen and Zejian Yuan and Xiaogang Wang},
journal= {arXiv preprint arXiv:1808.01571},
year = {2018}
}
备注
ECCV