3D神经嵌入似然:面向鲁棒6D位姿估计的概率逆图形学方法
计算机视觉与模式识别
2023-09-08 v3
摘要
感知和理解三维场景的能力对计算机视觉与机器人领域的诸多应用至关重要。逆图形学是一种颇具吸引力的三维场景理解方法,旨在从二维图像推断三维场景结构。本文在逆图形学框架中引入概率建模,以量化不确定性并在6D位姿估计任务中实现鲁棒性。具体而言,我们提出3D神经嵌入似然(3DNEL)作为对RGB-D图像的统一概率模型,并开发了在三维场景描述上的高效推断流程。3DNEL有效结合了来自RGB的学习神经嵌入与深度信息,从而提升基于RGB-D图像的模拟到真实(sim-to-real)6D物体位姿估计的鲁棒性。在YCB-Video数据集上的性能与当前最优(SOTA)相当,但在具有挑战性的场景下明显更为鲁棒。与判别方法不同,3DNEL的概率生成式表述联合建模场景中的多个物体,以原则性方式量化不确定性,并能处理重度遮挡下的物体位姿跟踪。最后,3DNEL提供了一个原则性框架以融入关于场景与物体的先验知识,从而可自然扩展至如从视频中进行相机位姿跟踪等额外任务。
引用
@article{arxiv.2302.03744,
title = {3D Neural Embedding Likelihood: Probabilistic Inverse Graphics for Robust 6D Pose Estimation},
author = {Guangyao Zhou and Nishad Gothoskar and Lirui Wang and Joshua B. Tenenbaum and Dan Gutfreund and Miguel Lázaro-Gredilla and Dileep George and Vikash K. Mansinghka},
journal= {arXiv preprint arXiv:2302.03744},
year = {2023}
}
备注
ICCV 2023 camera ready