无需位姿标注的类别级物体位姿估计器学习
计算机视觉与模式识别
2024-04-09 v1
摘要
3D物体位姿估计是一项具有挑战性的任务。以往的工作通常需要数千张带有位姿标注的物体图像来学习3D位姿对应关系,这使得标注过程费时费力。在本文中,我们提出在无需位姿标注的情况下学习类别级3D物体位姿估计器。我们不使用人工标注的图像,而是利用扩散模型(例如 Zero-1-to-3)在受控的位姿差异下生成一组图像,并提出利用这些图像来学习我们的物体位姿估计器。直接使用原始扩散模型会导致生成的图像存在位姿噪声和伪影。为了解决这一问题,首先,我们利用一个通过专门设计的对比位姿学习训练的图像编码器,来滤除不合理的细节并提取图像特征图。此外,我们提出了一种新颖的学习策略,使得模型能够在未知其规范位姿对齐的情况下,从这些生成的图像集中学习物体位姿。实验结果表明,我们的方法能够在单样本设置下(作为位姿定义)进行类别级物体位姿估计,并在少样本类别级物体位姿估计基准上显著优于其他 state-of-the-art 方法。
引用
@article{arxiv.2404.05626,
title = {Learning a Category-level Object Pose Estimator without Pose Annotations},
author = {Fengrui Tian and Yaoyao Liu and Adam Kortylewski and Yueqi Duan and Shaoyi Du and Alan Yuille and Angtian Wang},
journal= {arXiv preprint arXiv:2404.05626},
year = {2024}
}