中文

使用在合成图像上训练的深度卷积神经网络进行目标检测

计算机视觉与模式识别 2017-09-19 v2

摘要

训练卷积神经网络 (CNN) 所需的大型标注图像数据集一直是其在计算机视觉应用中推广的重大障碍。我们证明,通过迁移学习,一个有效的目标检测器几乎可以完全在合成渲染的数据集上进行训练。我们将此策略应用于检测冰箱场景中聚集的包装食品。我们仅用 4000 张合成图像训练的 CNN,在包含 55 种不同目标产品和 17 种干扰物的测试集上达到了 24 的平均精度均值 (mAP)。在这 4000 张合成图像的训练集中仅添加 400 张真实图像,mAP 进一步提高了 12%。合成图像的高度照片级真实感对于达到此性能并非必需。我们分析了训练数据集大小和 3D 模型字典大小等因素对检测性能的影响。此外,还探索了影响从合成场景到真实场景迁移学习的训练策略,如选定层的微调和早停法。使用合成数据集训练 CNN 是高性能计算的一种新颖应用,也是在缺乏大型标注图像数据的领域中用于目标检测应用的一种有前景的方法。

关键词

引用

@article{arxiv.1706.06782,
  title  = {Object Detection Using Deep CNNs Trained on Synthetic Images},
  author = {Param S. Rajpura and Hristo Bojinov and Ravi S. Hegde},
  journal= {arXiv preprint arXiv:1706.06782},
  year   = {2017}
}