FreeZe:基于几何与视觉基础模型的无训练零样本 6D 位姿估计
计算机视觉与模式识别
2025-01-09 v3
摘要
估计训练时未见物体的 6D 位姿是人们高度期望但又颇具挑战的任务。零样本物体 6D 位姿估计方法通过利用由大规模、照片级真实感合成数据集所提供的额外任务特定监督来应对这一挑战。然而,它们的性能严重依赖于渲染数据的质量与多样性,并且需要大量训练。在本工作中,我们展示了如何在不针对特定数据进行训练的情况下完成同一任务。我们提出了 FreeZe,一种利用预训练几何与视觉基础模型能力的新颖解决方案。FreeZe 利用从无关 3D 点云中学习到的 3D 几何描述符,以及从网络规模 2D 图像中学习到的 2D 视觉特征,来生成具有判别性的 3D 点级描述符。然后,我们基于 RANSAC 通过 3D 配准来估计未见物体的 6D 位姿。我们还引入了一种基于视觉特征的新颖算法,以解决由几何对称物体导致的歧义情形。我们在 BOP Benchmark 的七个核心数据集上对 FreeZe 进行了全面评估,这些数据集涵盖了一百多个 3D 物体以及在不同场景下采集的 20,000 多张图像。FreeZe 始终优于所有 SOTA 方法,包括在合成 6D 位姿估计数据上经过大量训练的竞争方法。代码将在 https://andreacaraffa.github.io/freeze 公开。
引用
@article{arxiv.2312.00947,
title = {FreeZe: Training-free zero-shot 6D pose estimation with geometric and vision foundation models},
author = {Andrea Caraffa and Davide Boscaini and Amir Hamza and Fabio Poiesi},
journal= {arXiv preprint arXiv:2312.00947},
year = {2025}
}
备注
Accepted to ECCV 2024. Project page: https://andreacaraffa.github.io/freeze