中文

PoET:用于单视图多物体 6D 姿态估计的 Pose Estimation Transformer

计算机视觉与模式识别 2022-11-28 v1

摘要

准确的 6D 物体姿态估计对于诸如抓取或定位等多种机器人应用是一项重要任务。由于物体对称性、杂乱和遮挡,这是一项具有挑战性的任务,但当不提供深度和 3D 模型等额外信息时变得更具挑战性。我们提出一种基于 transformer 的方法,以 RGB 图像作为输入并预测图像中每个物体的 6D 姿态。除图像外,我们的网络不需要任何额外信息,如深度图或 3D 物体模型。首先,图像通过物体检测器以生成特征图并检测物体。然后,特征图与检测到的边界框作为额外信息一起输入到 transformer 中。之后,输出的物体查询由一个独立的平移和旋转头处理。我们在具有挑战性的 YCB-V 数据集上取得了 RGB-only 方法的 SOTA 结果。我们展示了所得模型作为 6-DoF 状态估计任务的姿态传感器的适用性。代码可在 https://github.com/aau-cns/poet 获取。

关键词

引用

@article{arxiv.2211.14125,
  title  = {PoET: Pose Estimation Transformer for Single-View, Multi-Object 6D Pose Estimation},
  author = {Thomas Jantos and Mohamed Amin Hamdad and Wolfgang Granig and Stephan Weiss and Jan Steinbrener},
  journal= {arXiv preprint arXiv:2211.14125},
  year   = {2022}
}

备注

Supplementary material available: https://www.aau.at/wp-content/uploads/2022/09/jantos_poet.pdf , Code available: https://github.com/aau-cns/poet