LAC-Net:用于遮挡下准确机器人抓取的线性融合注意力引导卷积网络
机器人学
2024-08-07 v1 计算机视觉与模式识别
摘要
本文解决了通过视觉感知完整感知物体形状的挑战。虽然先前研究在分段场景中可见物体部分方面取得了令人鼓舞的结果,但特别是 amodal 分段有潜力允许机器人推断物体的遮挡部分。为此,本文引入了一种新框架,用于在杂乱场景中进行 amodal 分段,从而大大增强了机器人抓取能力。最初,我们使用常规分段算法检测目标物体的可见段,从而为完整物体掩码提供形状先验。特别地,为了探索如何利用 RGB 图像的语义特征和深度图像的几何信息,我们提出了线性融合注意力引导卷积网络 (LAC-Net)。LAC-Net 利用线性融合策略有效地融合跨模态数据,然后将先前可见掩码用作注意力图,以引导网络聚焦于目标特征位置以进行进一步的完整掩码恢复。使用目标物体的 amodal 掩码可在仅依赖可见段时选择更准确和稳健的抓取点的方面提供优势。不同数据集上的结果表明,我们的方法实现了最新的性能。 Furthermore, 机器人实验验证了该方法在实际世界中具有可行性和稳健性。我们的代码和演示在项目页面提供:https://jrryzh.github.io/LAC-Net。
引用
@article{arxiv.2408.03238,
title = {LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion},
author = {Jinyu Zhang and Yongchong Gu and Jianxiong Gao and Haitao Lin and Qiang Sun and Xinwei Sun and Xiangyang Xue and Yanwei Fu},
journal= {arXiv preprint arXiv:2408.03238},
year = {2024}
}
备注
accepted by IROS2024