基于无人机时空多尺度注意力网络的联合密度图估计、定位与跟踪
计算机视觉与模式识别
2019-12-05 v1
摘要
本文提出一种时空多尺度注意力网络(STANet),用于解决无人机拍摄视频片段中密集人群的密度图估计、定位与跟踪问题,该问题涉及任意人群密度、视角和飞行高度。我们的 STANet 方法聚合连续帧中的多尺度特征图以利用时间相干性,然后同时预测密度图、定位目标并在人群中关联它们。设计了一个由粗到细的过程,逐步在聚合的多尺度特征图上应用注意力模块,以迫使网络利用有判别力的时空特征从而获得更好性能。整个网络以端到端方式通过多任务损失训练,该损失由三项组成,即密度图损失、定位损失和关联损失。采用非极大值抑制后接最小代价流框架来生成场景中目标的运动轨迹。由于现有人群计数数据集仅关注静态相机下的人群计数,而非无人机上人群的密度图估计、计数与跟踪,我们收集了一个新的大规模无人机数据集 DroneCrowd,由 112 个视频片段和 33,600 张高分辨率帧(即 1920x1080)组成,拍摄于 70 个不同场景。经过大量人工标注,我们的数据集提供了 20,800 条人员轨迹、480 万个头部标注以及序列中的若干视频级属性。在 Shanghaitech、UCF-QNRF 两个具挑战性的公开数据集以及我们的 DroneCrowd 上进行了充分实验,表明 STANet 相比最先进方法取得了优越性能。数据集与代码见 https://github.com/VisDrone。
引用
@article{arxiv.1912.01811,
title = {Drone-based Joint Density Map Estimation, Localization and Tracking with Space-Time Multi-Scale Attention Network},
author = {Longyin Wen and Dawei Du and Pengfei Zhu and Qinghua Hu and Qilong Wang and Liefeng Bo and Siwei Lyu},
journal= {arXiv preprint arXiv:1912.01811},
year = {2019}
}