结合视觉与语言的行人重识别
计算机视觉与模式识别
2017-10-04 v1
摘要
本文提出了一种利用图像和自然语言描述进行行人重识别的新方法。我们提出了一种基于 CCA 和 CNN 架构的视觉-语言联合模型,以实现跨两种模态的匹配,并为没有语言描述的视觉样本进行特征增强。我们还为两个标准的 Re-ID 基准数据集(即 CUHK03 和 VIPeR)引入了自然语言描述形式的新标注。我们在这些数据集上进行了实验,使用了基于 CNN、手工特征以及 LSTM 的技术来分析视觉和自然描述数据。我们研究并展示了在 Re-ID 任务中,使用自然语言描述相较于属性的优势,以及 CNN 相较于 LSTM 的优势。结果表明,联合使用语言和视觉可以显著提升标准 Re-ID 基准上的 SOTA 性能。
引用
@article{arxiv.1710.01202,
title = {Person Re-Identification with Vision and Language},
author = {Fei Yan and Krystian Mikolajczyk and Josef Kittler},
journal= {arXiv preprint arXiv:1710.01202},
year = {2017}
}