中文

Zero123-6D:面向 RGB 类别级 6D 位姿估计的零样本新视角合成

计算机视觉与模式识别 2024-07-31 v2

摘要

通过视觉估计物体位姿对于使机器人平台与环境交互至关重要。然而,这带来了许多挑战,通常与当前最优解决方案缺乏灵活性和泛化能力有关。扩散模型是一种前沿神经架构,正在改变 2D 和 3D 计算机视觉,在零样本新视角合成方面展现出卓越性能。此类用例对于重建 3D 物体尤为引人关注。然而,在非结构化环境中定位物体却鲜有探索。为此,本工作提出了 Zero123-6D,这是首个通过将基于扩散模型的新视角合成器与特征提取技术相结合,来展示其在增强 RGB 类别级 6D 位姿估计方面效用的工作。新视角合成允许获得一个粗略位姿,该位姿通过本工作引入的一种在线优化方法进行细化,以处理类别内的几何差异。通过这种方式,所提出的方法显示出数据需求的减少、在零样本类别级 6D 位姿估计任务中消除了对深度信息的必要性,以及性能的提升,这些均通过在 CO3D 数据集上的实验进行了定量证明。

关键词

引用

@article{arxiv.2403.14279,
  title  = {Zero123-6D: Zero-shot Novel View Synthesis for RGB Category-level 6D Pose Estimation},
  author = {Francesco Di Felice and Alberto Remus and Stefano Gasperini and Benjamin Busam and Lionel Ott and Federico Tombari and Roland Siegwart and Carlo Alberto Avizzano},
  journal= {arXiv preprint arXiv:2403.14279},
  year   = {2024}
}

备注

6 pages, 2 reference pages, 4 figures