基于深度引导与跨模态注意力的 RGB-D 抓取检测
机器人学
2023-03-01 v1 计算机视觉与模式识别
摘要
平面抓取检测是机器人操作中最基础的任务之一,消费级 RGB-D 传感器的最新进展使得从纹理和形状两种模态中提取更全面的特征成为可能。然而,与 RGB 图像相比,深度图通常质量较低且噪声更强,这使得获取抓取深度和融合多模态线索具有挑战性。针对这两个问题,本文提出了一种新颖的基于学习的 RGB-D 抓取检测方法,即深度引导跨模态注意力网络 (DGCAN)。为了更好地利用深度通道中记录的几何信息,除了常见的 5 维表示中定义的参数外,还采用了完整的 6 维矩形表示,并专门考虑了抓取深度。对额外抓取深度的预测显著增强了特征学习,从而得到更准确的结果。此外,为了减少两种模态间数据质量差异造成的负面影响,设计了局部跨模态注意力 (LCA) 模块,该模块根据跨模态关系细化深度特征,并将其与 RGB 特征拼接以实现更充分的融合。进行了大量的仿真和物理评估,实验结果突显了所提方法的优越性。
关键词
引用
@article{arxiv.2302.14264,
title = {RGB-D Grasp Detection via Depth Guided Learning with Cross-modal Attention},
author = {Ran Qin and Haoxiang Ma and Boyang Gao and Di Huang},
journal= {arXiv preprint arXiv:2302.14264},
year = {2023}
}
备注
Accepted at ICRA 2023