中文

变分扫视:面向高分辨率图像的高效推断

计算机视觉与模式识别 2019-09-09 v3 机器学习 机器学习

摘要

使用深度神经网络的图像分类通常局限于小维度图像,例如Resnet模型中的224 x 244。这一限制排除了现代智能手机相机和智能设备所拍摄的4000 x 3000维度图像。在这项工作中,我们旨在缓解在此类大维度空间中运行所带来的过高推断与内存成本。为从高分辨率原始输入分布中采样,我们提出使用较小的代理分布来学习对应于高维空间中感兴趣区域的坐标。我们引入了一个新的有原则的变分下界,它以最大化条件分类似然的方式捕捉代理分布后验与原始图像坐标空间之间的关系。我们在一项合成基准和一项真实世界高分辨率单反相机图像数据集上实证表明,与利用整个原始输入分布的模型相比,我们的方法以约10倍更快的推断和更低的内存消耗产生了可比的结果。最后,我们使用来自Starcraft II的迷你地图在更复杂的设定下进行实验,以推断复杂3D渲染场景中的角色数量。即使在如此复杂的场景中,我们的模型也提供了强定位能力:这是传统分类模型所缺失的特征。

关键词

引用

@article{arxiv.1812.03170,
  title  = {Variational Saccading: Efficient Inference for Large Resolution Images},
  author = {Jason Ramapuram and Maurits Diephuis and Frantzeska Lavda and Russ Webb and Alexandros Kalousis},
  journal= {arXiv preprint arXiv:1812.03170},
  year   = {2019}
}

备注

Published BMVC 2019 & NIPS 2018 Bayesian Deep Learning Workshop