中文

学习可泛化的全尺度表征用于行人重识别

计算机视觉与模式识别 2021-04-30 v5

摘要

一个有效的行人重识别(re-ID)模型应当学习既具有判别性(用于区分外貌相似的人)又具有可泛化性(用于跨数据集无需任何适配即可部署)的特征表征。本文中,我们开发新颖的 CNN 架构以应对这两大挑战。首先,我们提出一种称为全尺度网络(OSNet)的 re-ID CNN,用于学习不仅捕获不同空间尺度而且封装多尺度协同组合(即全尺度特征)的特征。基本构建块由多个卷积流组成,每个流检测某一尺度上的特征。对于全尺度特征学习,引入统一聚合门以通过通道权重动态融合多尺度特征。OSNet 是轻量级的,因为其构建块由分解卷积组成。其次,为改进可泛化特征学习,我们将实例归一化(IN)层引入 OSNet 以应对跨数据集差异。进一步,为确定这些 IN 层在架构中的最优放置位置,我们提出了一种高效的可微架构搜索算法。大量实验表明,在传统的同数据集设定下,尽管 OSNet 远小于现有 re-ID 模型,其仍达到了最先进的性能。在更具挑战性但更实用的跨数据集设定下,OSNet 在不使用任何目标数据的情况下击败了多数近期无监督域适应方法。我们的代码和模型发布于 \texttt{https://github.com/KaiyangZhou/deep-person-reid}。

关键词

引用

@article{arxiv.1910.06827,
  title  = {Learning Generalisable Omni-Scale Representations for Person Re-Identification},
  author = {Kaiyang Zhou and Yongxin Yang and Andrea Cavallaro and Tao Xiang},
  journal= {arXiv preprint arXiv:1910.06827},
  year   = {2021}
}

备注

TPAMI 2021. Journal extension of arXiv:1905.00953. Updates: added appendix. arXiv admin note: text overlap with arXiv:1905.00953