中文

6D-ViT:基于 Transformer 的实例表示学习用于类别级 6D 物体位姿估计

计算机视觉与模式识别 2022-11-07 v2

摘要

本文提出 6D-ViT,一种基于 Transformer 的实例表示学习网络,适用于 RGB-D 图像上高精度的类别级物体位姿估计。具体而言,一种新颖的双流编码器-解码器框架致力于从 RGB 图像、点云和类别形状先验中探索复杂而强大的实例表示。为此,整个框架由两个主要分支组成,称为 Pixelformer 和 Pointformer。Pixelformer 包含一个金字塔 Transformer 编码器和一个全 MLP 解码器,用于从 RGB 图像中提取逐像素外观表示,而 Pointformer 依靠级联 Transformer 编码器和全 MLP 解码器从点云中获取逐点几何特征。然后,以形状先验、外观和几何信息作为输入,从多源聚合网络中获得稠密实例表示(即对应矩阵、形变场)。最后,通过利用稠密表示、形状先验和实例点云之间的对应关系来计算实例的 6D 位姿。在合成和真实世界数据集上的大量实验表明,所提出的 3D 实例表示学习框架在两个数据集上均达到了最先进的性能,并显著优于所有现有方法。

关键词

引用

@article{arxiv.2110.04792,
  title  = {6D-ViT: Category-Level 6D Object Pose Estimation via Transformer-based Instance Representation Learning},
  author = {Lu Zou and Zhangjin Huang and Naijie Gu and Guoping Wang},
  journal= {arXiv preprint arXiv:2110.04792},
  year   = {2022}
}

备注

13 pages, 12 figures