基于几何注意力引导多视图融合的三维人群计数
计算机视觉与模式识别
2024-10-31 v2
摘要
近来,使用深度神经网络的多视图人群计数被提出,以利用多个相机实现大范围宽场景中的计数。现有方法将相机视图特征投影到 3D 世界的平均高度平面,然后融合投影后的多视图特征以预测地面(即鸟瞰图)上的 2D 场景级密度图。与以往研究不同,我们考虑 3D 世界中人的可变高度,并提出通过具有 3D 场景级密度图(而非地面上的 2D 密度图)的 3D 特征融合来解决多视图人群计数任务。与 2D 融合相比,3D 融合提取了沿 z 维(高度)的更多人信息,有助于解决跨多个视图的尺度变化。3D 密度图仍保留 2D 密度图的性质——其求和即为计数,同时提供关于人群密度的 3D 信息。此外,不同于在 2D 到 3D 投影中沿视图射线复制特征的标准方法,我们提出基于高度估计网络的注意力模块,迫使每个 2D 像素沿视图射线投影到一个 3D 体素。我们还探索了 3D 预测与 2D 视图中真值之间的投影一致性,以进一步增强计数性能。所提方法在合成与真实世界多视图计数数据集上测试,取得了优于或可与最先进水平相媲美的计数性能。
引用
@article{arxiv.2003.08162,
title = {3D Crowd Counting via Geometric Attention-guided Multi-View Fusion},
author = {Qi Zhang and Antoni B. Chan},
journal= {arXiv preprint arXiv:2003.08162},
year = {2024}
}
备注
IJCV