Swapout:学习深度架构的集成
计算机视觉与模式识别
2016-05-23 v1 机器学习
神经与进化计算
摘要
我们描述了 Swapout,一种新的随机训练方法,其优于结构相同的 ResNets,在 CIFAR-10 和 CIFAR-100 上取得了令人印象深刻的结果。Swapout 从丰富的架构集合中采样,包括 dropout、随机深度和残差架构作为特例。当视作正则化方法时,swapout 不仅像 dropout 那样抑制层内单元的共同适应,还跨网络层抑制。我们猜想 swapout 通过隐式绑定跨层参数实现了强正则化。当视作集成训练方法时,它比现有方法(如 dropout 或随机深度)采样了丰富得多的架构集合。我们提出了一种参数化,揭示了与现有架构的联系,并暗示了可供探索的丰富得多的架构集合。我们展示了我们的公式化方案提出了一种高效的训练方法,并在 CIFAR-10 和 CIFAR-100 上验证了我们的结论,匹配了最先进的精度。值得注意的是,我们的 32 层更宽模型表现类似于 1001 层 ResNet 模型。
引用
@article{arxiv.1605.06465,
title = {Swapout: Learning an ensemble of deep architectures},
author = {Saurabh Singh and Derek Hoiem and David Forsyth},
journal= {arXiv preprint arXiv:1605.06465},
year = {2016}
}
备注
Submitted to NIPS 2016