中文

在拥挤场景中恢复 6D 物体位姿并预测最佳下一视角

计算机视觉与模式识别 2016-04-20 v2

摘要

在拥挤场景(包含多个物体实例、严重前景遮挡和背景干扰物的场景)中的物体检测与 6D 位姿估计,已成为机器人和增强现实等许多快速发展技术领域中的一个重要问题。基于单帧的具有手动设计特征的 6D 位姿估计器仍无法应对上述挑战,这推动了针对无监督特征学习和最佳下一视角估计的研究。在本工作中,我们提出了一个完整框架,用于基于 Hough Forests 的单帧 6D 物体位姿估计和最佳下一视角预测,Hough Forests 是一种联合执行分类与回归的最先进物体位姿估计器。我们没有使用手动设计的特征,而是 a) 提出了一种使用 Sparse Autoencoder 从深度不变块中学习的无监督特征,以及 b) 提供了对各种最先进特征的广泛评估。此外,利用 Hough Forests 叶节点中执行的聚类,我们学习估计其他视角中不确定性的降低,从而将选择最佳下一视角的问题公式化。为了进一步改进位姿估计,我们提出了一种改进联合配准与假设验证模块作为最终精炼步骤,以拒绝错误检测。我们提供了两个受真实场景启发的额外具有挑战性的数据集,以广泛评估最先进方法和我们的框架。一个与家庭环境相关,另一个描绘了工业环境中常见的 bin-picking 场景。我们展示了我们的框架在公共数据集和我们的数据集上均显著优于最先进方法。

关键词

引用

@article{arxiv.1512.07506,
  title  = {Recovering 6D Object Pose and Predicting Next-Best-View in the Crowd},
  author = {Andreas Doumanoglou and Rigas Kouskouridas and Sotiris Malassiotis and Tae-Kyun Kim},
  journal= {arXiv preprint arXiv:1512.07506},
  year   = {2016}
}

备注

CVPR 2016 accepted paper, project page: http://www.iis.ee.ic.ac.uk/rkouskou/6D_NBV.html