面向静态摄像头的几何感知视频目标检测
计算机视觉与模式识别
2019-09-10 v1
摘要
本文我们提出一个几何感知的视频目标检测模型。具体地,我们考虑摄像头可被良好近似为静态的场景,例如视频监控,因此场景伪深度图可以很容易地从图像平面上目标的尺度推断出来。我们做出以下贡献:第一,我们将最近的无锚点检测器 (CornerNet [17]) 扩展到视频目标检测。为了在保持高效率的同时利用时空信息,所提出的模型接受视频片段作为输入,并仅对起始帧和结束帧进行预测,即目标边界框角点的热图以及用于分组的相应嵌入。第二,为应对目标检测中尺度变化的挑战,场景几何信息(例如导出的深度图)被显式地融入深度网络,用于多尺度特征选择和网络预测。第三,我们在 Carla 模拟器 [5] 生成的自动驾驶数据集和一个真实人体检测数据集 (DukeMTMC 数据集 [28]) 上验证了所提出的架构。与现有的竞争性单阶段或两阶段检测器相比,所提出的几何感知时空网络取得了显著更好的结果。
引用
@article{arxiv.1909.03140,
title = {Geometry-Aware Video Object Detection for Static Cameras},
author = {Dan Xu and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:1909.03140},
year = {2019}
}
备注
Accepted at BMVC 2019 as ORAL