中文

Mask6D:用于6D物体姿态估计的掩码化姿态先验

计算机视觉与模式识别 2025-07-10 v1

摘要

在 cluttered 或遮挡条件下,使用单目RGB图像进行鲁棒的6D物体姿态估计仍是一个具有挑战性的任务。一个原因是当前姿态估计算网络在使用2D特征主干时难以提取判别性且姿态感知的特征,尤其当RGB信息因目标在clutter场景中的遮挡而受限时。为缓解这一问题,我们提出了一种名为Mask6D的新颖姿态估计特定预训练策略。我们的ethods incorporates姿态感知的2D-3D对应映射和可见掩码图作为额外的模态信息,与RGB图像结合用于基于重建的模型预训练。本质上,2D-3D对应映射将变形的3D对象模型映射到2D像素,反映目标在相机坐标系中的姿态信息。同时,集成的可见掩码图可以有效地引导我们的模型忽略clutter背景信息。此外,设计了一种面向对象的预训练损失函数,以进一步促进我们的网络消除背景干扰。最后,我们通过常规的姿态训练策略对预训练的姿态感知网络进行微调,以实现可靠的姿态预测。大量实验验证了我们的方法优于以往的端到端姿态估计方法。

关键词

引用

@article{arxiv.2507.06486,
  title  = {Mask6D: Masked Pose Priors For 6D Object Pose Estimation},
  author = {Yuechen Xie and Haobo Jiang and Jin Xie},
  journal= {arXiv preprint arXiv:2507.06486},
  year   = {2025}
}

备注

Accepted at ICASSP 2024. 4 figures, 3 tables