中文

拥挤场景中的基于密度的对象检测

计算机视觉与模式识别 2025-04-15 v1

摘要

与通用场景相比,拥挤场景包含高度重叠的实例,导致:1)目标检测器训练期间锚框更模糊,2)推理期间更多预测极易在后处理过程中被错误抑制。为此,我们提出两种新策略:密度引导的锚框(DGA)和密度引导的NMS(DG-NMS),其使用对象密度图来联合计算最优锚框分配和重新加权,以及自适应NMS。具体而言,基于不平衡最优传输(UOT)问题,每个ground-truth对象的密度被传输到每个锚框位置,最小化传输成本。锚框上的密度构成实例特定的密度分布,据此DGA解码最优锚框分配和重新加权策略。同时,DG-NMS利用预测密度图自适应调整NMS阈值,以减少错误抑制。在UOT中,为消除由相邻重叠对象导致的模糊锚框特别设计了一种新颖的重叠感知传输成本。在具有Citypersons数据集的挑战性CrowdHuman数据集上进行的广泛实验表明,我们提出的密度引导检测器对拥挤度具有有效性和鲁棒性。代码和预训练模型将稍后公开。

关键词

引用

@article{arxiv.2504.09819,
  title  = {Density-based Object Detection in Crowded Scenes},
  author = {Chenyang Zhao and Jia Wan and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2504.09819},
  year   = {2025}
}