一种机器人视觉抓取设计:以高分辨率重思卷积神经网络
机器人学
2022-09-19 v2 计算机视觉与模式识别
机器学习
摘要
高分辨率表示对于基于视觉的机器人抓取问题十分重要。现有工作通常通过子网络将输入图像编码为低分辨率表示,再恢复高分辨率表示。这将丢失空间信息,并且当考虑多类物体或物体远离相机时,解码器引入的误差将更为严重。为解决这些问题,我们重新审视用于机器人感知任务的 CNN 设计范式。我们证明,相较于串行堆叠卷积层,使用并行分支将是机器人视觉抓取任务更强大的设计。特别地,我们为机器人感知任务提供了神经网络设计准则,例如高分辨率表示与轻量化设计,以回应不同操作场景中的挑战。我们随后开发了一种称为 HRG-Net 的新型抓取视觉架构,一种始终保持高分辨率表示并跨分辨率反复交换信息的并行分支结构。大量实验验证这两种设计能有效提升基于视觉的抓取准确率并加速网络训练。我们在物理真实环境中展示了一系列对比实验,见 Youtube:https://youtu.be/Jhlsp-xzHFY。
引用
@article{arxiv.2209.07459,
title = {A Robotic Visual Grasping Design: Rethinking Convolution Neural Network with High-Resolutions},
author = {Zhangli Zhou and Shaochen Wang and Ziyang Chen and Mingyu Cai and Zhen Kan},
journal= {arXiv preprint arXiv:2209.07459},
year = {2022}
}