中文

基于隐式一对多匹配的视频行人计数

计算机视觉与模式识别 2025-06-17 v1

摘要

视频行人计数(VIC)是一种新近提出的任务,旨在从视频中估算行人流量。它超越了传统视频人群计数(VCC)的方法,后者仅学习跨帧中重复行人模式的计数。与VCC不同,VIC的关键问题在于如何识别不同帧中共存的行人,这实际上是一个配对问题。现有VIC方法主要采用一对一(O2O)匹配策略,要求同一行人在不同帧之间必须精确匹配,因而对外观变化和漏检极其敏感。本文指出,O2O匹配可放宽为一对多(O2M)匹配问题,这更贴合VIC的本质,能够利用行人群散行为的优势。我们因此引入OMAN(One-to-Many Matching),一种简单却有效的VIC模型,具备隐式上下文生成器和一对多配对器。实验表明,OMAN在SenseCrowd和CroHD基准上实现了最先进的性能。代码已公开:https://github.com/tiny-smart/OMAN。

关键词

引用

@article{arxiv.2506.13067,
  title  = {Video Individual Counting With Implicit One-to-Many Matching},
  author = {Xuhui Zhu and Jing Xu and Bingjie Wang and Huikang Dai and Hao Lu},
  journal= {arXiv preprint arXiv:2506.13067},
  year   = {2025}
}