基于隐式场景表示的泛化位姿估计
计算机视觉与模式识别
2023-05-30 v1
摘要
六自由度(6-DoF)位姿估计是机器人操控流水线的重要组件。然而,它通常缺乏对新实例与物体类型的泛化能力。最广泛使用的方法在判别式设置中学习推断物体位姿,模型过滤有用信息以推断物体的精确位姿。尽管此类方法提供准确位姿,模型并未存储足够信息以泛化到新物体。本工作中,我们利用包含足够物体信息从而能以不同位姿渲染该物体的模型,来解决位姿估计的泛化能力问题。我们沿用通过反演神经渲染器来推断位姿的研究路线。我们提出 i-SRN 以最大化从输入位姿流向渲染场景的信息,并反演它们以在给定输入图像时推断位姿。具体地,我们通过引入独立的密度估计网络扩展场景表示网络(SRNs),并提出获取加权场景表示的新方法。我们研究了神经渲染器的若干初始位姿估计方式与损失函数。最终评估显示,与现有方法相比推断性能与速度均有显著提升。
引用
@article{arxiv.2305.17252,
title = {Generalizable Pose Estimation Using Implicit Scene Representations},
author = {Vaibhav Saxena and Kamal Rahimi Malekshan and Linh Tran and Yotto Koga},
journal= {arXiv preprint arXiv:2305.17252},
year = {2023}
}