中文

Fast YOLO:一种用于视频实时嵌入式目标检测的快速 You Only Look Once 系统

计算机视觉与模式识别 2017-09-19 v1 人工智能 神经与进化计算

摘要

目标检测被认为是计算机视觉领域最具挑战性的问题之一,因为它涉及场景中物体分类与物体定位的结合。最近,深度神经网络 (DNNs) 已被证明比其他方法具有更优越的目标检测性能,其中 YOLOv2(一种改进的 You Only Look Once 模型)在基于 DNN 的目标检测方法中,无论是在速度还是精度方面均处于最先进水平 (SOTA)。尽管 YOLOv2 能在强大的 GPU 上实现实时性能,但在计算能力和内存有限的嵌入式计算设备上利用该方法进行视频实时目标检测仍然极具挑战性。本文提出了一种名为 Fast YOLO 的新框架,这是一种快速的 You Only Look Once 框架,它加速了 YOLOv2,使其能够在嵌入式设备上以实时方式执行视频中的目标检测。首先,我们利用进化深度智能框架来演化 YOLOv2 网络架构,生成一种优化架构(此处称为 O-YOLOv2),其参数量减少了 2.8 倍,而交并比 (IOU) 仅下降约 2%。为了在保持性能的同时进一步降低嵌入式设备的功耗,我们在提出的 Fast YOLO 框架中引入了一种运动自适应推理方法,该方法基于时间运动特性减少使用 O-YOLOv2 进行深度推理的频率。实验结果表明,所提出的 Fast YOLO 框架平均减少了 38.13% 的深度推理次数,与原始 YOLOv2 相比,视频目标检测的平均加速比约为 3.3 倍,使得 Fast YOLO 在 Nvidia Jetson TX1 嵌入式系统上的平均运行速度达到约 18 FPS。

关键词

引用

@article{arxiv.1709.05943,
  title  = {Fast YOLO: A Fast You Only Look Once System for Real-time Embedded Object Detection in Video},
  author = {Mohammad Javad Shafiee and Brendan Chywl and Francis Li and Alexander Wong},
  journal= {arXiv preprint arXiv:1709.05943},
  year   = {2017}
}