中文

学习计算机视觉的推理模型

计算机视觉与模式识别 2017-09-04 v1

摘要

计算机视觉可理解为对图像数据进行推理的能力。计算机视觉技术的突破常以推理技术的进步为标志。本论文提出新颖的推理方案,并展示其在计算机视觉中的应用。我们为生成式和判别式视觉模型均提出推理技术。生成式模型在视觉中的应用常因后验推理的困难而受阻。我们提出改进MCMC采样和消息传递推理的技术。我们的推理策略是学习单独的判别式模型,以辅助生成式模型中的贝叶斯推理。在一系列生成式模型上的实验表明,所提技术加速了推理过程并/或收敛到更优解。判别式模型设计的一个主要难点是融入先验知识。我们聚焦于CNN模型,并提出将标准空间卷积推广为双边卷积。我们推广了现有的双边滤波器用法,进而提出具有可学习双边滤波器的新型神经网络架构,称之为“双边神经网络”。实验展示了双边网络在广泛的图像与视频任务及数据集上的应用。总之,我们为从逆向图形学到自由参数化神经网络的多种视觉模型提出了更优推理技术。在生成式模型中,我们的推理技术缓解了贝叶斯后验推理中的一些关键障碍,为基于模型的机器学习在视觉中的应用开辟了新途径。在判别式CNN模型中,所提出的滤波器推广有助于设计能处理稀疏高维数据的新型神经网络架构,并提供了一种将先验知识融入CNN的方法。

关键词

引用

@article{arxiv.1709.00069,
  title  = {Learning Inference Models for Computer Vision},
  author = {Varun Jampani},
  journal= {arXiv preprint arXiv:1709.00069},
  year   = {2017}
}

备注

PhD Dissertation