中文

面向家用物体语义抓取的深度物体位姿估计

机器人学 2018-10-01 v1

摘要

使用合成数据训练用于机器人操作的深度神经网络,有望提供几乎无限量的预标注训练数据,且可安全地在无危害环境下生成。迄今为止,合成数据的关键挑战之一是弥合所谓的现实鸿沟,使在合成数据上训练的网络在暴露于真实世界数据时能正确运行。我们在已知物体从单张 RGB 图像的 6-DoF 位姿估计背景下探讨现实鸿沟。我们表明,对于该问题,现实鸿沟可通过域随机化与照片级真实数据的简单组合成功跨越。利用以此方式生成的合成数据,我们引入一个一次性深度神经网络,能够与使用真实与合成数据组合训练的最先进网络竞争。据我们所知,这是首个仅在合成数据上训练且能在 6-DoF 物体位姿估计上达到最先进性能的深层网络。我们的网络对新颖环境(包括极端光照条件)也具有更好的泛化能力,我们给出了定性结果。利用该网络,我们展示了一个实时系统,能以足够精度估计物体位姿,供真实机器人在杂乱中对已知家用物体进行真实世界语义抓取。

关键词

引用

@article{arxiv.1809.10790,
  title  = {Deep Object Pose Estimation for Semantic Robotic Grasping of Household Objects},
  author = {Jonathan Tremblay and Thang To and Balakumar Sundaralingam and Yu Xiang and Dieter Fox and Stan Birchfield},
  journal= {arXiv preprint arXiv:1809.10790},
  year   = {2018}
}

备注

Conference on Robot Learning (CoRL) 2018