中文

DeepContext: 用于三维整体场景理解的上下文编码神经通路

计算机视觉与模式识别 2017-08-17 v4

摘要

尽管深度神经网络已在计算机视觉任务上达到人类水平性能,但它们尚未在整体场景理解上展现出类似的提升。特别是,3D上下文已被证明是场景理解极其重要的线索——然而在将上下文信息与深度模型集成方面所做的研究极少。本文提出一种将3D上下文嵌入到训练用于整体场景理解的神经网络拓扑结构中的方法。给定描绘3D场景的深度图像,我们的网络将观测场景与预定义的3D场景模板对齐,然后推断该场景模板内每个物体的存在与位置。在此过程中,我们的模型在3D卷积神经网络的单次前向传播中识别多个物体,同时捕获全局场景与局部物体信息。为创建该3D网络的训练数据,我们生成部分幻觉深度图像,其通过用同一物体类别的CAD模型库替换真实物体来渲染。大量实验证明了我们的算法相比最先进方法的有效性。源代码和数据可在 http://deepcontext.cs.princeton.edu 获取。

关键词

引用

@article{arxiv.1603.04922,
  title  = {DeepContext: Context-Encoding Neural Pathways for 3D Holistic Scene Understanding},
  author = {Yinda Zhang and Mingru Bai and Pushmeet Kohli and Shahram Izadi and Jianxiong Xiao},
  journal= {arXiv preprint arXiv:1603.04922},
  year   = {2017}
}

备注

Accepted by ICCV2017