中文

通过复用跨模态嵌入实现图像到视频行人重识别

计算机视觉与模式识别 2018-10-23 v2

摘要

图像到视频行人重识别旨在通过非重叠摄像头拍摄的大量行人视频中的探针图像来识别目标行人。尽管已取得巨大进展,在多模态场景(即图像与视频之间)进行匹配仍然具有挑战性。目前,最先进的方法主要关注特定任务的数据,忽略了不同但相关任务上的额外信息。本文中,我们提出一种端到端神经网络框架,通过利用从额外信息中学习到的跨模态嵌入来实现图像到视频行人重识别。具体而言,复用图像描述(image captioning)和视频描述(video captioning)模型中的跨模态嵌入,以帮助将学习到的特征投影到协调空间中,从而可直接计算相似度。此外,将固定模型复用方法的训练步骤集成到我们的框架中,这能够融入有益信息并最终使目标网络独立于现有模型。除此之外,我们提出的框架借助 CNN 和 LSTM 提取视觉与时空特征,并结合识别与验证模型的优势以提升所学特征的判别能力。实验结果表明,我们的框架在缩小异构数据间的差距以及在图像到视频行人重识别上取得可观改进方面是有效的。

关键词

引用

@article{arxiv.1810.03989,
  title  = {Image-to-Video Person Re-Identification by Reusing Cross-modal Embeddings},
  author = {Zhongwei Xie and Lin Li and Xian Zhong and Luo Zhong},
  journal= {arXiv preprint arXiv:1810.03989},
  year   = {2018}
}

备注

under review for Pattern Recognition Letters