中文

GI-NNet与RGI-NNet:在监督与半监督范式下可分别用大规模及有限标注训练集训练的机器人抓取位姿模型开发

机器人学 2021-07-16 v1 人工智能

摘要

我们的抓取物体方式对COBOTs实现高效、智能且最优的抓取而言颇具挑战。为简化该过程,此处我们采用深度学习技术帮助机器人学习快速生成并执行恰当抓取。我们开发了生成式Inception神经网络(GI-NNet)模型,能够在已见及未见物体上生成对映体机器人抓取。该模型在Cornell Grasping Dataset (CGD)上训练,在从RGB-Depth (RGB-D)图像中检测规则与不规则形状物体时达到98.87%的抓取位姿准确率,且所需网络可训练参数仅为现有方法的三分之一。然而,为达到此性能水平,模型需要CGD中全部90%的可用标注数据,仅留10%标注数据用于测试,这使其易于泛化不佳。此外,获取充足且高质量的标注数据集正日益困难,难以匹配巨型网络的需求。为解决这些问题,我们将模型作为解码器接入基于半监督学习的架构,即Vector Quantized Variational Auto Encoder (VQVAE),其在可用标注与未标注数据上训练时均高效。所提模型我们命名为基于表示的GI-NNet(RGI-NNet),已在CGD上以低至10%标注数据集配合VQVAE生成的潜嵌入、至高50%标注数据集配合VQVAE所得潜嵌入的多种标注数据划分下训练。RGI-NNet的抓取位姿准确率性能水平介于92.13%至95.6%之间,远优于若干仅用标注数据集训练的现有模型。为验证GI-NNet与RGI-NNet模型性能,我们使用Anukul (Baxter)硬件cobot。

关键词

引用

@article{arxiv.2107.07452,
  title  = {GI-NNet \& RGI-NNet: Development of Robotic Grasp Pose Models, Trainable with Large as well as Limited Labelled Training Datasets, under supervised and semi supervised paradigms},
  author = {Priya Shukla and Nilotpal Pramanik and Deepesh Mehta and G. C. Nandi},
  journal= {arXiv preprint arXiv:2107.07452},
  year   = {2021}
}