中文

用于拥挤行人检测的 DETR

计算机视觉与模式识别 2021-02-19 v3

摘要

由于从锚框到行人的启发式定义映射以及 NMS 与高度重叠行人之间的冲突,拥挤场景中的行人检测是一个具有挑战性的问题。近期提出的端到端检测器(ED)DETR 与可变形 DETR 利用 transformer 架构取代了 NMS 与锚框等人工设计组件,其通过计算查询间的所有成对交互消除了重复预测。受这些工作启发,我们探究了它们在拥挤行人检测上的性能。令人惊讶的是,与带 FPN 的 Faster-RCNN 相比,所得结果不同于在 COCO 上获得的结果。此外,由于拥挤场景中真实框数量大,ED 的二分匹配损害了训练效率。本工作中,我们揭示了导致 ED 性能不佳的潜在动因,并提出了一种新的解码器以解决这些问题。此外,我们设计了一种机制,专门利用行人中遮挡较少的可见部分以用于 ED,并取得了进一步改进。还引入了一种更快的二分匹配算法,使 ED 在拥挤数据集上的训练更为实用。所提出的检测器 PED(Pedestrian End-to-end Detector)在 CityPersons 与 CrowdHuman 上均优于先前的 ED 与基线 Faster-RCNN,并取得了与最先进行人检测方法相当的性能。代码将很快发布。

关键词

引用

@article{arxiv.2012.06785,
  title  = {DETR for Crowd Pedestrian Detection},
  author = {Matthieu Lin and Chuming Li and Xingyuan Bu and Ming Sun and Chen Lin and Junjie Yan and Wanli Ouyang and Zhidong Deng},
  journal= {arXiv preprint arXiv:2012.06785},
  year   = {2021}
}