中文

拥挤场景中的渐进式端到端目标检测

计算机视觉与模式识别 2022-05-03 v3

摘要

本文提出一种新的基于查询的检测框架用于拥挤场景检测。以往的基于查询的检测器存在两个缺陷:其一,在拥挤场景中通常会对单个物体推断出多个预测;其二,随着解码阶段深度的增加性能趋于饱和。得益于一对一标签分配规则的本质,我们提出一种渐进式预测方法来解决上述问题。具体而言,我们首先筛选易于生成真阳性预测的已接受查询,然后根据先前接受的预测对剩余的噪声查询进行精炼。实验表明,我们的方法能显著提升基于查询的检测器在拥挤场景中的性能。结合我们的方法,Sparse RCNN 在具有挑战性的 CrowdHuman 数据集上取得了 92.0% AP、41.4% MR^{-2} 和 83.2% JI,优于专门处理拥挤场景的基于框的方法 MIP。此外,该方法对拥挤程度具有鲁棒性,在 CityPersons 和 COCO 等中等及轻度拥挤的数据集上仍能获得一致的提升。代码将公开于 https://github.com/megvii-model/Iter-E2EDET。

关键词

引用

@article{arxiv.2203.07669,
  title  = {Progressive End-to-End Object Detection in Crowded Scenes},
  author = {Anlin Zheng and Yuang Zhang and Xiangyu Zhang and Xiaojuan Qi and Jian Sun},
  journal= {arXiv preprint arXiv:2203.07669},
  year   = {2022}
}