中文

基于注意力时空特征融合的复杂丛林相机陷阱影像中大猿检测

计算机视觉与模式识别 2019-08-30 v1

摘要

我们提出首个经训练用于检测大猿的多帧视频目标检测框架。它适用于复杂丛林环境中具挑战性的相机陷阱影像,并通过在空间与时间域添加自注意力驱动的特征融合,扩展了传统的特征金字塔架构。我们证明该扩展能在显著局部遮挡下检测独特的物种外观与运动特征。我们使用来自泛非计划、包含 180K 帧的 500 段大猿相机陷阱视频评估该框架,这些视频均由我们手动标注了精确的逐帧动物边界框。这些片段包含显著局部遮挡、挑战性光照、动态背景与自然伪装效应。我们表明我们的方法高度鲁棒,并显著优于基于帧的检测器。我们还在完整的 ILSVRC 2015 VID 数据语料上进行了详细消融研究及验证,以在充足性能水平下证明更广泛的适用性。我们结论为该框架已可协助人工相机陷阱核查工作。我们随本文发布代码、权重与真值标注。

关键词

引用

@article{arxiv.1908.11240,
  title  = {Great Ape Detection in Challenging Jungle Camera Trap Footage via Attention-Based Spatial and Temporal Feature Blending},
  author = {Xinyu Yang and Majid Mirmehdi and Tilo Burghardt},
  journal= {arXiv preprint arXiv:1908.11240},
  year   = {2019}
}

备注

Accepted by ICCV workshop 2019