利用位置编码实现鲁棒的基于多参考的物体6D姿态估计
计算机视觉与模式识别
2024-01-30 v1
摘要
精确估计物体姿态是计算机视觉和机器人学中的一项关键任务。目前主要有两种深度学习方法:几何表示回归和迭代优化。然而,这些方法存在一些限制,降低了其有效性。在本文中,我们分析了这些限制并提出了新的策略来克服它们。为了解决几何表示模糊的问题,我们对物体的三维坐标使用了具有高频分量的位置编码。为了解决优化方法中的局部最小值问题,我们引入了一种基于归一化图像平面的、独立于内参矩阵约束的多参考优化策略。最后,我们利用自适应实例归一化和一种简单的遮挡增强方法来帮助模型聚焦于目标物体。我们在Linemod、Linemod-Occlusion和YCB-Video数据集上的实验表明,我们的方法优于现有方法。我们将很快发布代码。
引用
@article{arxiv.2401.16284,
title = {Leveraging Positional Encoding for Robust Multi-Reference-Based Object 6D Pose Estimation},
author = {Jaewoo Park and Jaeguk Kim and Nam Ik Cho},
journal= {arXiv preprint arXiv:2401.16284},
year = {2024}
}