何处、何物、是否:多模态学习应用于行人检测
计算机视觉与模式识别
2020-12-22 v1
摘要
行人检测极大地受益于深度卷积神经网络(CNNs)。然而,CNNs 本质上难以处理存在遮挡和尺度变化的情况。在本文中,我们提出 WNet,它试图通过将行人检测任务分解为针对行人定位、尺度预测和分类的何处(Where)、何物(What)和是否(Whether)问题来应对上述挑战。具体而言,对于一个行人实例,我们通过三个步骤构建其特征。i) 我们生成鸟瞰图,其天然不受遮挡问题影响,并扫描其上所有点以为每个行人实例寻找合适位置。ii) 我们没有使用预固定锚框,而是建模深度与尺度之间的相互依赖关系,旨在不同位置生成深度引导的尺度以更好地匹配不同大小的实例。iii) 我们学习一个由视觉空间和语料空间共享的潜向量,借此过滤掉具有相似垂直结构但缺乏人体局部特征的误检正样本。我们在广泛使用的数据集(Citypersons 和 Caltech)上取得了最先进的结果。特别地,在重度遮挡子集上评估时,我们的结果在 Citypersons 上将 MR 从 49.3 降低到 18.7,在 Caltech 上从 45.18 降低到 28.33。
引用
@article{arxiv.2012.10880,
title = {Where, What, Whether: Multi-modal Learning Meets Pedestrian Detection},
author = {Yan Luo and Chongyang Zhang and Muming Zhao and Hao Zhou and Jun Sun},
journal= {arXiv preprint arXiv:2012.10880},
year = {2020}
}
备注
This work is being revised. The updated version will be upload few months later