LabelFusion:一种为杂乱场景真实RGBD数据生成真值标签的流程
计算机视觉与模式识别
2017-09-27 v3 机器人学
摘要
深度神经网络(DNN)架构已被证明在使用RGBD数据进行物体分割和位姿估计时优于传统流程,但这些DNN流程的性能直接取决于训练数据对真实数据的代表性。因此,在实践中采用这些方法的一个关键要求是拥有针对特定机器人操作任务的大量标注数据,而这一要求通常未被现有数据集满足。本文中,我们开发了一个流程,用于快速生成带有像素级标签和物体位姿的高质量RGBD数据。我们使用RGBD相机从多个视角采集场景视频,并利用现有重建技术生成3D稠密重建。我们通过人工辅助的物体网格ICP拟合来标注3D重建。通过重投影3D场景标注结果,我们可以为场景的每个RGBD图像生成标签。该流程使我们仅在几天内就收集了超过1,000,000个标注物体实例。我们利用该数据集回答了关于需要多少训练数据以及数据必须达到何种质量才能从DNN架构获得高性能的问题。
引用
@article{arxiv.1707.04796,
title = {LabelFusion: A Pipeline for Generating Ground Truth Labels for Real RGBD Data of Cluttered Scenes},
author = {Pat Marion and Peter R. Florence and Lucas Manuelli and Russ Tedrake},
journal= {arXiv preprint arXiv:1707.04796},
year = {2017}
}