中文

使用常见单图像 CNN 进行视频目标检测的问题

计算机视觉与模式识别 2021-05-28 v1 图像与视频处理

摘要

计算机视觉中一个不断发展的分支是目标检测。目标检测被用于工业流程、医学影像分析和自动驾驶车辆等诸多应用。在视频中检测目标的能力至关重要。目标检测系统是在大型图像数据集上训练的。对于自动驾驶车辆等应用,目标检测系统能够跨视频多帧识别目标至关重要。将这些系统应用于视频存在许多问题。阴影或亮度变化可能导致系统逐帧错误识别目标,并引发非预期的系统响应。已有许多用于目标检测的神经网络,若能有一种跨帧关联目标的方法,这些问题便可消除。要使这些神经网络在视频目标识别上表现更好,需要对它们重新训练。必须创建一个数据集,其中的图像代表连续视频帧,并具有匹配的 ground-truth 层。本文提出一种可生成此类数据集的方法。ground-truth 层仅包含运动目标。为生成该层,使用 FlowNet2-Pytorch 通过新颖的 Magnitude Method 创建光流掩码。同时,将使用 Mask R-CNN 或 Refinenet 等网络生成分割掩码。这些分割掩码包含一帧中检测到的所有目标。通过将此分割掩码与光流掩码 ground-truth 层比较,生成损失函数。该损失函数可用于训练神经网络,使其在视频上做出更一致的预测。系统在多个视频样本上进行了测试,并为每帧生成了损失,证明了 Magnitude Method 在未来用于训练目标检测神经网络的能力。

关键词

引用

@article{arxiv.2105.12822,
  title  = {Issues in Object Detection in Videos using Common Single-Image CNNs},
  author = {Spencer Ploeger and Lucas Dasovic},
  journal= {arXiv preprint arXiv:2105.12822},
  year   = {2021}
}

备注

5 pages, 6 figures, supplementary material at: https://drive.google.com/drive/folders/1qXZd8nObw84jSYklAFjNnH6djVymr65N?usp=sharing