中文

基于 Transformer 的机器人抓取检测

机器人学 2022-05-31 v1

摘要

杂乱环境中的抓取检测对机器人仍是巨大挑战。当前 Transformer 机制已成功应用于视觉任务,其优异的全局上下文信息提取能力为提升杂乱场景下机器人抓取检测性能提供了可行途径。然而,原始 Transformer 模型归纳偏置能力不足,需大规模数据集训练,而抓取检测难以获取此类数据。本文提出一种基于编码器–解码器结构的抓取检测模型。编码器采用 Transformer 网络提取全局上下文信息;解码器采用全卷积神经网络提升模型归纳偏置能力,并融合编码器提取的特征以预测最终抓取配置。在 VMRD 数据集上的实验表明,本模型在重叠物体场景中表现更优。同时,在 Cornell Grasp 数据集上,本方法准确率达 98.1%,与 SOTA 算法相当。

关键词

引用

@article{arxiv.2205.15112,
  title  = {Robotic grasp detection based on Transformer},
  author = {Mingshuai Dong and Xiuli Yu},
  journal= {arXiv preprint arXiv:2205.15112},
  year   = {2022}
}