LocaliseBot:基于可微渲染多视角三维物体定位的机器人抓取
计算机视觉与模式识别
2023-11-16 v1 机器学习
摘要
机器人抓取通常经历五个阶段:物体检测、物体定位、物体位姿估计、抓取位姿估计与抓取规划。我们聚焦于物体位姿估计。我们的方法依赖三类信息:物体的多视角图像、这些视角下相机的外参,以及物体的三维CAD模型。第一步采用标准深度学习骨干网络(FCN ResNet)估计物体标签、语义分割,以及相对于相机的物体位姿粗估计。我们的创新在于使用一个细化模块,从粗位姿估计出发,通过可微渲染优化对其进行细化。这是一种纯基于视觉的方法,避免了对点云或深度图像等其他信息的需求。我们在ShapeNet数据集上评估了物体位姿估计方法,并展示出优于当前最优方法的性能。我们还表明,在OCID Grasp数据集上,按标准做法计算,估计的物体位姿配合真实抓取候选可实现99.65%的抓取准确率。
引用
@article{arxiv.2311.08438,
title = {LocaliseBot: Multi-view 3D object localisation with differentiable rendering for robot grasping},
author = {Sujal Vijayaraghavan and Redwan Alqasemi and Rajiv Dubey and Sudeep Sarkar},
journal= {arXiv preprint arXiv:2311.08438},
year = {2023}
}