SEMPose:一种用于多目标姿态估计的单一端到端网络
计算机视觉与模式识别
2024-11-22 v1
摘要
在计算机视觉中,从RGB图像估计六自由度姿态是一项基本任务。然而,在多目标场景中,这项任务变得极具挑战性。目前,最好的方法通常采用间接策略,即识别2D和3D对应点,然后通过透视n点法求解。然而,这种方法无法进行端到端训练。另一方面,直接方法由于目标尺寸变化和遮挡等挑战,精度较低。为了解决这些问题,我们提出了SEMPose,一种端到端的多目标姿态估计网络。SEMPose利用精心设计的纹理形状引导特征金字塔网络,有效应对了目标尺寸变化的挑战。此外,它采用迭代细化头结构,逐步分别回归旋转和平移,以提高估计精度。在训练过程中,我们通过从可见部分选择正样本来减轻遮挡的影响。实验结果表明,SEMPose可以在32 FPS下进行推理,无需除RGB图像以外的输入。它能够实时准确估计多个目标的姿态,且推理时间不受目标数量影响。在LM-O和YCB-V数据集上,我们的方法优于其他基于RGB的单模型方法,实现了更高的精度。即使与多模型方法和使用额外细化的方法相比,我们的结果仍然具有竞争力。
引用
@article{arxiv.2411.14002,
title = {SEMPose: A Single End-to-end Network for Multi-object Pose Estimation},
author = {Xin Liu and Hao Wang and Shibei Xue and Dezong Zhao},
journal= {arXiv preprint arXiv:2411.14002},
year = {2024}
}