中文

用于视觉识别的深度协作学习

计算机视觉与模式识别 2017-03-06 v1

摘要

深度神经网络在最先进的视觉识别中发挥着重要作用。为了表示高级视觉概念,现代网络配备了大型卷积层,这些层使用大量滤波器,并显著增加了模型复杂度。例如,AlexNet 超过一半的权重存储在第一个全连接层(4,096 个滤波器)中。我们将卷积层的功能表述为学习大型视觉词汇表,并提出了一种替代方法,即深度协作学习,以降低计算复杂度。我们用一个两阶段 DCL 模块替换卷积层,在该模块中我们首先单独构建几个较小的卷积层,然后在每个空间位置融合它们以考虑特征共现。在数学上,DCL 可以解释为学习组合视觉概念的有效方式,其中词汇表大小呈指数增长,而模型复杂度仅呈线性增长。我们在广泛的视觉识别任务上评估了 DCL,包括一系列多数字数字分类数据集,以及一些通用图像分类数据集,如 SVHN、CIFAR 和 ILSVRC2012。我们将 DCL 应用于几种最先进的网络结构,在提高识别准确率的同时减少了参数数量(在 AlexNet 中减少了 16.82%)。

关键词

引用

@article{arxiv.1703.01229,
  title  = {Deep Collaborative Learning for Visual Recognition},
  author = {Yan Wang and Lingxi Xie and Ya Zhang and Wenjun Zhang and Alan Yuille},
  journal= {arXiv preprint arXiv:1703.01229},
  year   = {2017}
}

备注

Submitted to CVPR 2017 (10 pages, 5 figures)