获取数值正确——建模稠密且多样场景中的多类目标计数
计算机视觉与模式识别
2026-04-16 v2
摘要
密度图估计可实现稠密、遮挡严重的场景中准确的对象计数,其中基于检测的计数方法效果差。 在多类密度估计中,通过非专属地建模类别可更好地反映拥挤且视觉上模糊的情境。然而,现有的多类密度估计器往往在较稀疏场景中性能下降,而最先进的检测器仍在最拥挤的设置中难以胜任。为填补这一差距,我们提出了首个基于视觉转换器的多类密度估计方法。我们的模型将Twins-SVT金字塔视觉转换器主干与多尺度CNN解码器相结合,利用层次特征实现跨密度范围的稳健计数。此外,该方法添加一个辅助分割任务,利用类别聚焦模块在训练时抑制类别间的干扰。该模块在不要求推理时添加约束性假设的前序方法基础上,改进了密度估计头。 在VisDrone和iSAID基准上的训练和评估表明,我们的方法在多类密度估计方法中实现了显著的性能提升,在测试评估中将MAE分别降低了33%、43%和64%。该方法在较不忙的场景中超越YOLO11,在最拥挤的测试样本中表现出约一个数量级的优势。代码和训练好的权重可在 https://github.com/LCAS/gnr_mcdest 获取。
引用
@article{arxiv.2510.02213,
title = {Getting the Numbers Right$\unicode{x2014}$Modelling Multi-Class Object Counting in Dense and Varied Scenes},
author = {Villanelle O'Reilly and Jonathan Cox and Georgios Leontidis and Marc Hanheide and Petra Bosilj and James M. Brown},
journal= {arXiv preprint arXiv:2510.02213},
year = {2026}
}
备注
8 pages, 4 figures, 5 tables