中文

行人重识别:隐式定义深度学习分类框架的感知野

机器学习 2020-07-06 v4 计算机视觉与模式识别 机器学习

摘要

深度学习分类模型的\emph{感知野}决定了输入数据中对于提供正确决策最具显著性的区域。学习此类感知野的主要方式是在被掩码的数据上训练模型,这有助于网络忽略任何不需要的区域,但有两个主要缺点:1)它常产生边缘敏感的决策过程;以及 2)显著增加了推理阶段的计算成本。本文描述了一种通过创建由应\emph{先验}对网络决策重要/无关的交换片段组成的合成学习数据,来隐式驱动网络感知野推断的解决方案。在实践中,我们使用分割模块区分每个学习实例的前景(重要)/背景(无关)部分,并在图像对之间随机交换片段,同时保持类标签仅与被视为重要片段的标签一致。该策略通常驱动网络早期收敛与适当解,其中身份与杂波描述不相关。此外,该数据增强方案具有多种有趣性质:1)它是无参数的;2)它完全保留标签信息;以及 3)它与典型数据增强技术兼容。在实证验证中,我们考虑了行人重识别问题,并在著名的\emph{Richly Annotated Pedestrian}(RAP)数据集上针对两种不同设置(\emph{上半身}与\emph{全身})评估了所提方案的有效性,观察到相对于当前最优(state-of-the-art)极具竞争力的结果。在可复现研究范式下,代码与实证评估协议均可在 \url{https://github.com/Ehsan-Yaghoubi/reid-strong-baseline} 获取。

关键词

引用

@article{arxiv.2001.11267,
  title  = {Person Re-identification: Implicitly Defining the Receptive Fields of Deep Learning Classification Frameworks},
  author = {Ehsan Yaghoubi and Diana Borza and Aruna Kumar and Hugo Proença},
  journal= {arXiv preprint arXiv:2001.11267},
  year   = {2020}
}

备注

Submitted to PRL