MV-ROPE:用于鲁棒类别级物体位姿与尺寸估计的多视角约束
计算机视觉与模式识别
2024-03-25 v3
摘要
近来类别级物体位姿与尺寸估计日益受到关注,主流方法通常依赖单视角 RGB-D 图像。然而,此类方法的一个缺点是需精确深度图,而消费级传感器无法提供。此外,许多实际场景涉及持续观察周围的移动相机,单视角方法完全忽视了输入视频流的时间信息。我们提出一种利用 RGB 视频流的新方案。我们的框架包含三个模块:尺度感知单目稠密 SLAM 方案、轻量物体位姿预测器、以及物体级位姿图优化器。SLAM 模块利用视频流与附加尺度敏感读数估计相机位姿与度量深度。物体位姿预测器随后从 RGB 图像生成规范物体表示。通过这些规范物体表示与估计物体深度点的几何配准来估计物体位姿。所有单视角估计最终在位姿图内优化,输出鲁棒且准确的规范物体位姿。实验结果表明,在利用含高质量深度信息的公开数据集序列时,所提方法展现出与最优 RGB-D 方法相当的性能。我们还收集并基于含不同质量深度图的新数据集评估,以进一步定量基准测试所提方法与先前基于 RGB-D 的方法。我们展示了在缺失深度输入或深度感知质量受限场景下的显著优势。
引用
@article{arxiv.2308.08856,
title = {MV-ROPE: Multi-view Constraints for Robust Category-level Object Pose and Size Estimation},
author = {Jiaqi Yang and Yucong Chen and Xiangting Meng and Chenxin Yan and Min Li and Ran Cheng and Lige Liu and Tao Sun and Laurent Kneip},
journal= {arXiv preprint arXiv:2308.08856},
year = {2024}
}