深度信念网络在图像分类中的行为与性能
神经与进化计算
2009-12-04 v1 计算机视觉与模式识别
摘要
我们将基于受限玻尔兹曼机的深度信念网络应用于从 13 Scenes、15 Scenes 和 Caltech 256 数据库中提取的 SIFT 特征词袋,并实验研究了其行为与性能。我们发现,如果系统经过预训练,在监督阶段能够快得多地达到最终性能。在保持监督数据集不变的情况下,在更大数据集上对系统进行预训练可以提高性能(针对 13 Scenes 的情况)。在无监督预训练之后,会出现形成若干类别近似显式表示的神经元(即它们主要对该类别激活)。最后三个事实表明,无监督训练确实发现了这些数据中的结构。预训练可以在完全不同的数据集上进行(我们使用 Corel 数据集),我们发现监督阶段的执行效果同样好(在 15 Scenes 数据集上)。这使我们推测,可以一次性预训练系统(例如在工厂中),随后将其应用于许多监督问题,这些监督问题随后将学习得更快。单隐层系统获得了最佳性能,这表明 SIFT 特征的直方图没有太多高层结构。整体性能几乎相当,但略差于支持向量机和空间金字塔匹配。
引用
@article{arxiv.0912.0717,
title = {Behavior and performance of the deep belief networks on image classification},
author = {Karol Gregor and Gregory Griffin},
journal= {arXiv preprint arXiv:0912.0717},
year = {2009}
}
备注
8 pages, 9 figures