BoxDreamer:面向可泛化物体位姿估计的边界框角点生成
计算机视觉与模式识别
2025-10-01 v2
摘要
本文提出了一种基于 RGB 的可泛化物体位姿估计方法,专门用于应对稀疏视角设置下的挑战。虽然现有方法能够估计未见物体的位姿,但在涉及遮挡和稀疏参考视角的场景中,其泛化能力仍然有限,制约了其在真实世界中的适用性。为了克服这些局限性,我们引入物体边界框的角点作为物体位姿的中间表示。3D 物体角点可以从稀疏输入视角中可靠地恢复,而目标视角中的 2D 角点则通过一种新颖的基于参考的点合成器进行估计,该合成器即使在涉及遮挡的场景中也能良好工作。作为物体语义点,物体角点利用 PnP 算法自然地建立起用于物体位姿估计的 2D-3D 对应关系。在 YCB-Video 和 Occluded-LINEMOD 数据集上的大量实验表明,我们的方法优于 SOTA 方法,突出了所提出表示的有效性,并显著增强了物体位姿估计的泛化能力,这对于真实世界应用至关重要。
引用
@article{arxiv.2504.07955,
title = {BoxDreamer: Dreaming Box Corners for Generalizable Object Pose Estimation},
author = {Yuanhong Yu and Xingyi He and Chen Zhao and Junhao Yu and Jiaqi Yang and Ruizhen Hu and Yujun Shen and Xing Zhu and Xiaowei Zhou and Sida Peng},
journal= {arXiv preprint arXiv:2504.07955},
year = {2025}
}
备注
ICCV 2025 Camera Ready, Project page: https://zju3dv.github.io/boxdreamer