中文

基于单目视觉的端到端多实例机器人抓取

机器人学 2024-01-23 v1

摘要

多实例场景对于端到端视觉运动(图像到控制)学习算法尤其具有挑战性。“流水线”视觉伺服控制算法使用独立的检测、选择和伺服阶段,允许算法在伺服控制期间专注于单个对象实例。端到端系统没有独立的检测和选择阶段,需要在伺服控制期间解决由任意数量的视觉相同或相似对象的存在引入的视觉模糊性。然而,端到端方案避免了将检测和选择阶段的嵌入误差引入伺服控制行为,对场景变化具有更强的动态鲁棒性,并且在算法上更简单。在本文中,我们提出了一种用于多实例抓取的实时端到端视觉运动学习算法。所提出的算法使用单目RGB图像和机械臂关节角度作为轻量级全卷积网络(FCN)的输入,以生成控制候选。该方法的一个关键创新是通过回归控制Lyapunov函数(cLf)值来识别最优控制候选。多实例能力自然地从与cLf公式相关的稳定性分析中产生。我们展示了所提出的算法在桌面上的其他实例和干扰物中,通过肩部单目RGB相机有效地抓取不同类别的物体。网络在单个GTX 1080 Ti GPU上推理时能够达到约160 fps。

关键词

引用

@article{arxiv.2401.11834,
  title  = {End-to-end Multi-Instance Robotic Reaching from Monocular Vision},
  author = {Zheyu Zhuang and Xin Yu and Robert Mahony},
  journal= {arXiv preprint arXiv:2401.11834},
  year   = {2024}
}

备注

This manuscript was published in ICRA21, not a new paper