中文

基于深度学习的自动驾驶汽车自动视频标注工具

计算机视觉与模式识别 2019-04-30 v1

摘要

在自动驾驶汽车中,目标检测、目标分类、车道检测和目标跟踪被视为关键模块。近来,人们希望利用实时视频来叙述安装在车辆上的摄像头所捕捉的场景。为有效实现该任务,深度学习技术和自动视频标注工具被广泛使用。在本文中,我们比较了各模块可用的多种技术,并使用适当的指标从中选择最佳算法。对于目标检测,考虑了 YOLO 和 Retinanet-50,并基于平均精度均值(mAP)选择最佳者。对于目标分类,我们考虑 VGG-19 和 Resnet-50,并基于低错误率和良好准确率选择最佳算法。对于车道检测,比较了 Udacity 的“Finding Lane Line”和基于深度学习的 LaneNet 算法,并选择能准确识别给定车道的最佳者进行实现。在目标跟踪方面,我们比较了 Udacity 的“Object Detection and Tracking”算法和基于深度学习的 Deep Sort 算法。基于在多帧中跟踪同一目标并预测目标运动的准确率,选择最佳算法。我们的自动视频标注工具与人工标注者相比准确率为 83%。我们考虑了一段包含 530 帧、每帧分辨率为 1035 x 1800 像素的视频。平均每帧约有 15 个目标。我们的标注工具在基于 CPU 的系统中处理全部四个模块耗时 43 分钟,在基于中端 GPU 的系统中耗时 2.58 分钟。但同一段视频由一名人工标注者叙述场景耗时近 3060 分钟。因此我们声称,我们提出的自动视频标注工具相当快速(在 GPU 系统中约快 1200 倍)且准确。

关键词

引用

@article{arxiv.1904.12618,
  title  = {Deep Learning Based Automatic Video Annotation Tool for Self-Driving Car},
  author = {N. S. Manikandan and K. Ganesan},
  journal= {arXiv preprint arXiv:1904.12618},
  year   = {2019}
}

备注

8 pages, 9 Figures