ZS6D:基于视觉Transformer的零样本6D物体位姿估计
计算机视觉与模式识别
2023-09-22 v1
摘要
随着机器人系统日益遭遇复杂且无约束的真实世界场景,对识别多样物体的需求随之产生。最先进的6D物体位姿估计方法依赖于特定物体训练,因此无法泛化至未见过的物体。近期的新物体位姿估计方法通过用于深度模板匹配的任务特定微调CNN解决此问题。这种为位姿估计的适配仍需要昂贵的数据渲染与训练流程。例如,MegaPose在由两百万张图像组成、展示20,000个不同物体的数据集上训练以达成此类泛化能力。为克服此缺陷,我们引入ZS6D,用于零样本新物体6D位姿估计。利用预训练的视觉Transformer(ViT)提取的视觉描述子,将渲染模板与物体的查询图像进行匹配,并建立局部对应关系。这些局部对应关系能够推导几何对应,并用于通过基于RANSAC的PnP估计物体的6D位姿。该方法表明,预训练ViT提取的图像描述子非常适合于在无需任务特定微调的情况下,相较两种最先进的新物体6D位姿估计方法取得显著提升。实验在LMO、YCBV和TLESS上进行。与其中一种方法相比,我们在所有三个数据集上提升了平均召回率;与第二种方法相比,我们在两个数据集上有所提升。
引用
@article{arxiv.2309.11986,
title = {ZS6D: Zero-shot 6D Object Pose Estimation using Vision Transformers},
author = {Philipp Ausserlechner and David Haberger and Stefan Thalhammer and Jean-Baptiste Weibel and Markus Vincze},
journal= {arXiv preprint arXiv:2309.11986},
year = {2023}
}