中文

解耦深度卷积网络中的局部与全局形变用于图像分类与滑动窗口检测

计算机视觉与模式识别 2014-12-02 v1

摘要

深度卷积神经网络通常使用通用的“最大池化”层来提取形变不变特征,但我们主张采用更精细的处理方式。首先,我们引入缩影卷积作为常见卷积-最大池化级联结构的替代构建模块;在与最大池化具有相同复杂度的同时,缩影卷积允许跨不同滤波器共享参数,从而实现更快的收敛和更好的泛化。其次,我们引入一种多示例学习方法,以在仅使用类别标签训练深度卷积神经网络时显式地适应全局平移和缩放。为此,我们依赖一种“拼缀”数据结构,该结构将所有图像尺度和位置高效地布局为深度卷积神经网络的候选。分解全局和局部形变使得深度卷积神经网络能够“集中资源”处理非刚性形变,并带来显著的分类精度提升。第三,进一步推进这一思路,我们开发了一种高效的深度卷积神经网络滑动窗口目标检测器,该检测器对位置、尺度和宽高比进行显式搜索。我们在 ImageNet 数据集上提供了具有竞争力的图像分类和定位结果,并在 Pascal VOC 2007 基准上提供了目标检测结果。

关键词

引用

@article{arxiv.1412.0296,
  title  = {Untangling Local and Global Deformations in Deep Convolutional Networks for Image Classification and Sliding Window Detection},
  author = {George Papandreou and Iasonas Kokkinos and Pierre-André Savalle},
  journal= {arXiv preprint arXiv:1412.0296},
  year   = {2014}
}

备注

13 pages, 7 figures, 5 tables. arXiv admin note: substantial text overlap with arXiv:1406.2732