中文

LDC-Net:面向密集人群定位、检测与计数的统一框架

计算机视觉与模式识别 2021-10-12 v1

摘要

视觉人群分析的快速发展显示出通过定位甚至检测来计数人群的趋势,而非简单地对密度图求和。这也启发我们回归该领域的本质,即检测以计数,这能给出更丰富的人群信息并具有更实际的应用。然而,近期关于人群定位与检测的工作存在两点局限:1)典型检测方法无法处理密集人群及尺度的巨大变化;2)密度图启发式方法在位置和框预测上性能不足,尤其在高密度或大规模人群中。本文从新视角设计了一个面向密集人群定位、检测与计数的定制基线,简称为 LDC-Net,其具备以下特点:1)一种强大而极简的范式,仅通过预测位置图和尺寸图来检测目标,赋予其在任意容量场景(010,000+0 \sim 10,000+ 人)中检测的能力;2)在面对大变化(如头部尺寸在 0100,000+0 \sim 100,000+ 像素范围内)时出色的跨尺度能力;3)在位置和框预测任务上取得优越性能,且与基于密度的方法相比具有竞争力的计数性能。最后,源代码与预训练模型将被发布。

关键词

引用

@article{arxiv.2110.04727,
  title  = {LDC-Net: A Unified Framework for Localization, Detection and Counting in Dense Crowds},
  author = {Qi wang and Tao Han and Junyu Gao and Yuan Yuan and Xuelong Li},
  journal= {arXiv preprint arXiv:2110.04727},
  year   = {2021}
}

备注

17 Pages, 11 figures