中文

捕捉图像特征中的空间相互依赖关系:计数网格——一种面向特征包的精要表示

计算机视觉与模式识别 2014-10-28 v1 机器学习

摘要

在近期的场景识别研究中,图像或大图像区域常被表示为无序的特征“包”,随后可使用最初为捕捉文本中词频共变而开发的模型进行分析。然而,图像特征计数所受的约束方式可能与文本词频不同。例如,当摄像机从建筑物入口向上摇摄,经过其最初几层并继续向上进入天空时(图1),图像中的某些特征计数下降,而另一些上升——随后再次下降,让位于在更高处更常见的特征。所有可能的特征计数组合空间既受更大场景属性的约束,也受观察窗口大小与位置的约束。为捕捉此类变化,本文提出使用计数网格模型。该生成模型基于一个特征计数网格,其规模远大于任一被建模的图像,又远小于将图像紧密平铺所需的实际空间。每个被建模的图像被假定在网格中有一个代表性窗口,其中特征计数模拟了该图像中的特征分布。我们提供了一种学习过程,将训练集中的所有图像联合映射到计数网格,并估计其中恰当的局部计数。实验表明,所得表示比传统模型更准确地捕捉了特征计数组合空间,不仅在输入图像来自摇拍摄像机时如此,即使在对同一类别中不同场景的图像建模时亦然。

关键词

引用

@article{arxiv.1410.6264,
  title  = {Capturing spatial interdependence in image features: the counting grid, an epitomic representation for bags of features},
  author = {Alessandro Perina and Nebojsa Jojic},
  journal= {arXiv preprint arXiv:1410.6264},
  year   = {2014}
}

备注

The counting grid code is available at www.alessandroperina.com