基于深度的利用 Swin Transformer 的 6DoF 物体位姿估计
计算机视觉与模式识别
2023-05-01 v2 机器人学
摘要
准确估计物体的 6D 位姿对于许多应用至关重要,例如机器人抓取、自动驾驶和增强现实。然而,在光照条件差或处理无纹理物体时,该任务变得更具挑战性。为解决此问题,深度图像因其对场景外观的不变性以及隐式包含 essential 几何特征而日益受到青睐。然而,充分利用深度信息以提升位姿估计性能仍是一个困难且研究不足的问题。为应对这一挑战,我们提出了一种称为 SwinDePose 的新框架,其仅使用深度图像中的几何信息来实现准确的 6D 位姿估计。SwinDePose 首先计算深度图像中定义的每个法向量与相机坐标系下三个坐标轴之间的夹角。所得夹角随后被构成一幅图像,并由 Swin Transformer 编码。此外,我们应用 RandLA-Net 从点云中学习表示。所得图像与点云嵌入被拼接并送入语义分割模块与 3D 关键点定位模块。最后,我们基于目标物体预测的语义掩码与 3D 关键点,使用最小二乘拟合方法估计 6D 位姿。在 LineMod 与 Occlusion LineMod 数据集上的实验中,SwinDePose 优于现有的使用深度图像的 6D 物体位姿估计 SOTA 方法。这证明了我们方法的有效性,并凸显了其在真实场景中的潜力。我们的代码位于 https://github.com/zhujunli1993/SwinDePose。
引用
@article{arxiv.2303.02133,
title = {Depth-based 6DoF Object Pose Estimation using Swin Transformer},
author = {Zhujun Li and Ioannis Stamos},
journal= {arXiv preprint arXiv:2303.02133},
year = {2023}
}
备注
8 pages. We have submitted the paper to The IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023) on March 1st 2023