中文

StereOBJ-1M:面向 6D 物体位姿估计的大规模立体图像数据集

计算机视觉与模式识别 2022-03-16 v3 机器学习 机器人学

摘要

我们提出一个名为 StereOBJ-1M\textbf{StereOBJ-1M} 的大规模立体 RGB 图像物体位姿估计数据集。该数据集旨在应对诸如物体透明、半透明和镜面反射等挑战性情况,以及遮挡、对称性、光照与环境变化等常见挑战。为了收集足以满足现代深度学习模型规模的数据,我们提出了一种新颖的多视图高效标注位姿数据的方法,允许在复杂且灵活的环境中捕获数据。我们的数据集完整标注了 6D 物体位姿,包含超过 393K 帧和超过 1.5M 个标注,涵盖在 11 种不同环境中构建的 182 个场景里记录的 18 个物体。这 18 个物体包括 8 个对称物体、7 个透明物体和 8 个反射物体。我们在 StereOBJ-1M 上以两个最先进(SOTA)的位姿估计框架作为未来工作的基线进行基准测试。我们还提出了一种新颖的物体级位姿优化方法,用于从多幅图像中的关键点预测计算 6D 位姿。项目网站:https://sites.google.com/view/stereobj-1m。

关键词

引用

@article{arxiv.2109.10115,
  title  = {StereOBJ-1M: Large-scale Stereo Image Dataset for 6D Object Pose Estimation},
  author = {Xingyu Liu and Shun Iwase and Kris M. Kitani},
  journal= {arXiv preprint arXiv:2109.10115},
  year   = {2022}
}

备注

ICCV 2021