NormNet:面向堆叠场景中 6D 位姿估计的尺度归一化网络
计算机视觉与模式识别
2023-11-17 v1 人工智能
摘要
现有面向堆叠场景的物体位姿估计(OPE)方法对不同物体尺度变化缺乏鲁棒性。本文提出一种用于堆叠场景中不同尺度物体的新 6DoF OPE 网络(NormNet)。具体而言,首先通过逐点回归学习每个物体的尺度。然后,通过语义分割与仿射变换将堆叠场景中的所有物体归一化至同一尺度。最后,将它们输入共享位姿估计器以恢复其 6D 位姿。此外,我们引入了一种结合风格迁移与域随机化的新 Sim-to-Real 迁移流水线。这提升了 NormNet 在真实数据上的性能,即便我们仅在合成数据上训练它。大量实验表明,所提方法在公开基准与我们构建的 MultiScale 数据集上均达到了 SOTA 性能。真实世界实验显示,我们的方法能鲁棒估计不同尺度物体的 6D 位姿。
引用
@article{arxiv.2311.09269,
title = {NormNet: Scale Normalization for 6D Pose Estimation in Stacked Scenarios},
author = {En-Te Lin and Wei-Jie Lv and Ding-Tao Huang and Long Zeng},
journal= {arXiv preprint arXiv:2311.09269},
year = {2023}
}