神经网络的耦合集成
计算机视觉与模式识别
2017-09-21 v1 机器学习
摘要
本文研究了深度卷积网络的架构。在现有 SOTA 模型的基础上,我们提出在全局网络级别将模型参数重新配置为几个并行分支,每个分支都是一个独立的 CNN。我们表明,这种安排是一种在不损失性能的情况下显著减少参数数量的有效方法,或者在相同参数量下显著提高性能。分支的使用带来了另一种形式的正则化。除了划分为并行分支外,我们提出在训练期间将“融合(平均)层”放置在 Log-Likelihood 和 SoftMax 层之前,以实现这些分支之间更紧密的耦合。这带来了另一个显著的性能提升,更紧密的耦合有利于学习更好的表示,甚至在单个分支的级别上也是如此。我们将这种分支架构称为“耦合集成”。该方法非常通用,几乎可以应用于任何 DCNN 架构。使用 DenseNet-BC 的耦合集成和 25M 的参数预算,我们在 CIFAR-10、CIFAR-100 和 SVHN 任务上分别获得了 2.92%、15.68% 和 1.50% 的错误率。在相同的预算下,DenseNet-BC 的错误率分别为 3.46%、17.18% 和 1.8%。使用 DenseNet-BC 网络的耦合集成的集成,总参数为 50M,我们在这些任务上分别获得了 2.72%、15.13% 和 1.42% 的错误率。
引用
@article{arxiv.1709.06053,
title = {Coupled Ensembles of Neural Networks},
author = {Anuvabh Dutt and Denis Pellerin and Georges Quénot},
journal= {arXiv preprint arXiv:1709.06053},
year = {2017}
}