中文

使用视觉与语言描述进行行人重识别的卷积基线方法

计算机视觉与模式识别 2020-03-03 v1 机器学习 机器学习

摘要

经典的行人重识别方法假设感兴趣行人已出现在不同相机中,并可通过现有图像之一进行查询。然而,在真实监控场景中,经常无法获得被查询行人的视觉信息。在此类场景中,目击者对行人的自然语言描述将提供检索的唯一信息来源。本文在所有可能的图库与查询场景下,利用视觉与语言信息解决行人重识别问题。提出了一个由交叉熵损失监督的双流深度卷积神经网络框架。两网络中连接倒数第二层与具有类概率的最后一层(即 softmax 层的 logits)的权重是共享的。执行典型相关分析(Canonical Correlation Analysis)以增强联合潜在嵌入空间中两种模态的相关性。为探究所提方法的益处,针对 CUHK-PEDES 和 CUHK-SYSU 基准的测试划分,提出了一种多模态 ReID 设定下的新测试协议。实验结果验证了所提系统的优势。所学视觉表示更鲁棒,在检索中比单模态系统性能好 22%。多模态查询的检索在定量与定性上极大增强了系统的重识别能力。

关键词

引用

@article{arxiv.2003.00808,
  title  = {A Convolutional Baseline for Person Re-Identification Using Vision and Language Descriptions},
  author = {Ammarah Farooq and Muhammad Awais and Fei Yan and Josef Kittler and Ali Akbari and Syed Safwan Khalid},
  journal= {arXiv preprint arXiv:2003.00808},
  year   = {2020}
}

备注

12 pages including references, currently under review in IEEE transactions on Image Processing