中文

基于扩散特征的零样态 6DoF 对象姿态估计

计算机视觉与模式识别 2024-11-26 v1

摘要

零样态对象姿态估计无需针对特定对象进行训练即可从图像中检索对象姿态。近期方法通过视觉基础模型(VFM)实现,这些模型是预训练的,实际上是通用的特征提取器。这些 VFM 的特征会因训练数据、网络架构和训练范式的不同而有所不同。该领域的主流选择是自监督 Vision Transformer(ViT)。本研究评估了潜在扩散模型(LDM)背板对零样态姿态估计的影响。为在两个模型家族之间建立共同比较基准,我们采用并修改了近期方法。因此,本文提出了一种基于模板的多阶段方法,用于 LDM 实现零样态姿态估计。经实验评估,该方法在用于对象特定 6DoF 姿态估计的三个标准数据集上表现良好。实验显示,与 ViT 基线相比,平均召回率提高了最高 27%。源代码已公开于 https://github.com/BvG1993/DZOP。

关键词

引用

@article{arxiv.2411.16668,
  title  = {Diffusion Features for Zero-Shot 6DoF Object Pose Estimation},
  author = {Bernd Von Gimborn and Philipp Ausserlechner and Markus Vincze and Stefan Thalhammer},
  journal= {arXiv preprint arXiv:2411.16668},
  year   = {2024}
}