中文

基于隐式场景表示的泛化位姿估计

计算机视觉与模式识别 2023-05-30 v1

摘要

六自由度(6-DoF)位姿估计是机器人操控流水线的重要组件。然而,它通常缺乏对新实例与物体类型的泛化能力。最广泛使用的方法在判别式设置中学习推断物体位姿,模型过滤有用信息以推断物体的精确位姿。尽管此类方法提供准确位姿,模型并未存储足够信息以泛化到新物体。本工作中,我们利用包含足够物体信息从而能以不同位姿渲染该物体的模型,来解决位姿估计的泛化能力问题。我们沿用通过反演神经渲染器来推断位姿的研究路线。我们提出 i-σ\sigmaSRN 以最大化从输入位姿流向渲染场景的信息,并反演它们以在给定输入图像时推断位姿。具体地,我们通过引入独立的密度估计网络扩展场景表示网络(SRNs),并提出获取加权场景表示的新方法。我们研究了神经渲染器的若干初始位姿估计方式与损失函数。最终评估显示,与现有方法相比推断性能与速度均有显著提升。

关键词

引用

@article{arxiv.2305.17252,
  title  = {Generalizable Pose Estimation Using Implicit Scene Representations},
  author = {Vaibhav Saxena and Kamal Rahimi Malekshan and Linh Tran and Yotto Koga},
  journal= {arXiv preprint arXiv:2305.17252},
  year   = {2023}
}