中文

我在此能做什么?利用深度三维显著性与几何实现快速可扩展的多重可供性检测

计算机视觉与模式识别 2018-12-04 v1 机器人学

摘要

本文开发并评估了一种新方法,可在视觉恢复的点云上以可扩展和多实例方式检测可供性。我们的方法相较替代方法具有诸多优势,因其基于高度可并行化的一次性学习,在商用硬件上速度很快。该方法是混合式的,因为它使用几何表示与能够识别三维场景显著性的最先进深度学习方法相结合。几何组件实现了紧凑高效的表示,提升了深度网络架构的性能,而后者单独使用被证明不足。此外,我们的方法不仅能预测输入场景是否提供这些交互,还能预测允许这些交互发生的物体位姿。我们的预测与众包人类判断吻合良好,以 87% 的概率被偏好,相较仅深度学习的基线显示出近四倍(4x)的性能提升,且比先前方法快七倍(7x)。

关键词

引用

@article{arxiv.1812.00889,
  title  = {What can I do here? Leveraging Deep 3D saliency and geometry for fast and scalable multiple affordance detection},
  author = {Eduardo Ruiz and Walterio Mayol-Cuevas},
  journal= {arXiv preprint arXiv:1812.00889},
  year   = {2018}
}

备注

10 pages,9 figures