中文

面向室内场景目标检测的合成训练数据

计算机视觉与模式识别 2017-09-11 v2 机器人学

摘要

在杂乱的室内环境中进行目标检测是服务机器人的关键使能功能之一。计算机视觉中表现最佳的目标检测方法利用深度卷积神经网络(CNN),在杂乱场景中同时检测并分类感兴趣的目标。此类模型的训练通常需要大量标注训练数据,这些数据的获取既耗时又昂贵。在本工作中,我们探索了使用合成生成的复合图像来训练最先进的目标检测器的能力,特别是针对目标实例检测。我们将带纹理物体模型的 2D 图像以各种位置和尺度叠加到真实环境图像中。我们的实验评估了不同的叠加策略,范围从纯基于图像的混合,一直到利用深度和语义信息将物体模型定位到真实场景中。我们在两个公开数据集 GMU-Kitchens 和 Washington RGB-D Scenes v2 上证明了这些目标检测器训练策略的有效性。作为一种观察,将一些人工标注的训练数据与精心合成到场景中的合成样本相结合,所生成的目标检测器的性能与使用多得多的手工标注数据相当。总体而言,本工作通过利用现有的物体模型库,以纯自动方式或仅使用极少量人工标注样本,为训练新物体的检测器开辟了新机遇。

关键词

引用

@article{arxiv.1702.07836,
  title  = {Synthesizing Training Data for Object Detection in Indoor Scenes},
  author = {Georgios Georgakis and Arsalan Mousavian and Alexander C. Berg and Jana Kosecka},
  journal= {arXiv preprint arXiv:1702.07836},
  year   = {2017}
}

备注

Added more experiments and link to project webpage