中文

ClusterNet:利用时空信息检测大场景中的小目标

计算机视觉与模式识别 2017-12-06 v2

摘要

广域运动影像 (WAMI) 中的目标检测多年来引起了计算机视觉研究界的关注。WAMI 带来了一系列独特挑战,包括极小的目标尺寸、稀疏与密集堆叠并存的目标,以及极大的搜索空间(大视频帧)。几乎所有 WAMI 目标检测的最先进方法都报告称,基于外观的分类器在此具有挑战性的数据上失效,转而几乎完全依赖以背景减除或帧差形式出现的运动信息。在本工作中,我们通过实验验证了基于外观的分类器在 WAMI 中的失效,例如 Faster R-CNN 和基于热图的完全卷积神经网络 (CNN),并提出了一种新颖的两阶段时空 CNN,其有效且高效地结合外观与运动信息,显著超越 WAMI 目标检测的最优水平。为减小大搜索空间,第一阶段 (ClusterNet) 输入一组极大视频帧,在卷积架构内结合运动与外观信息,并提出感兴趣目标区域 (ROOBI)。由于 WAMI 中视频帧尺寸大且目标密度多变,这些 ROOBI 可包含从单个到数百个目标的簇。第二阶段 (FoveaNet) 随后通过热图估计同时估计该给定 ROOBI 中所有目标的中点位置。所提方法在 WPAFB 2009 数据集上对于运动目标超越最优结果 5-16%,对于停止目标超越近 50%,并且是广域运动影像中首个检测完全静止目标的方法。

关键词

引用

@article{arxiv.1704.02694,
  title  = {ClusterNet: Detecting Small Objects in Large Scenes by Exploiting Spatio-Temporal Information},
  author = {Rodney LaLonde and Dong Zhang and Mubarak Shah},
  journal= {arXiv preprint arXiv:1704.02694},
  year   = {2017}
}

备注

Main paper is 8 pages. Supplemental section contains a walk-through of our method (using a qualitative example) and qualitative results for WPAFB 2009 dataset