中文

FastPoseCNN:实时单目类别级姿态与尺寸估计框架

计算机视觉与模式识别 2024-06-18 v1

摘要

本文的主要重点是开发一个框架,用于在给定单张 RGB 图像的情况下,对未见物体进行姿态和尺寸估计——且全部实时完成。2019 年,首个类别级姿态和尺寸估计框架与两个名为 CAMERA 和 REAL 的新数据集一同被提出。然而,当前的方法因其较长的推理时间(2-4 fps)而限制了实际应用。他们方法的推理存在显著延迟,因为他们使用了计算昂贵的 MaskedRCNN 框架和 Umeyama 算法。为了优化我们的方法并产生实时结果,我们的框架使用了高效的 ResNet-FPN 框架,并通过使用不同的解码器将平移、旋转和尺寸回归问题解耦。此外,我们的方法在全局上下文中执行姿态和尺寸估计——即一次性估计图像中所有捕获物体的相关参数。我们进行了广泛的测试,以在精度和速度方面全面比较性能,从而证明我们方法的能力。

关键词

引用

@article{arxiv.2406.11063,
  title  = {FastPoseCNN: Real-Time Monocular Category-Level Pose and Size Estimation Framework},
  author = {Eduardo Davalos and Mehran Aminian},
  journal= {arXiv preprint arXiv:2406.11063},
  year   = {2024}
}

备注

11 pages, 12 figures, conference