中文

面向静态摄像头的几何感知视频目标检测

计算机视觉与模式识别 2019-09-10 v1

摘要

本文我们提出一个几何感知的视频目标检测模型。具体地,我们考虑摄像头可被良好近似为静态的场景,例如视频监控,因此场景伪深度图可以很容易地从图像平面上目标的尺度推断出来。我们做出以下贡献:第一,我们将最近的无锚点检测器 (CornerNet [17]) 扩展到视频目标检测。为了在保持高效率的同时利用时空信息,所提出的模型接受视频片段作为输入,并仅对起始帧和结束帧进行预测,即目标边界框角点的热图以及用于分组的相应嵌入。第二,为应对目标检测中尺度变化的挑战,场景几何信息(例如导出的深度图)被显式地融入深度网络,用于多尺度特征选择和网络预测。第三,我们在 Carla 模拟器 [5] 生成的自动驾驶数据集和一个真实人体检测数据集 (DukeMTMC 数据集 [28]) 上验证了所提出的架构。与现有的竞争性单阶段或两阶段检测器相比,所提出的几何感知时空网络取得了显著更好的结果。

关键词

引用

@article{arxiv.1909.03140,
  title  = {Geometry-Aware Video Object Detection for Static Cameras},
  author = {Dan Xu and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1909.03140},
  year   = {2019}
}

备注

Accepted at BMVC 2019 as ORAL