中文

固定内存预算下的深度集成:一个宽网络还是多个较窄网络?

机器学习 2020-05-18 v1 机器学习

摘要

现代深度学习普遍接受的观点之一是,增加参数数量通常能带来更好的质量。增加参数数量最简单的两种方式是增大网络规模(如宽度)或训练深度集成;这两种方法在实践中都能提升性能。在本工作中,我们考虑固定内存预算的设置,并研究哪种更有效:训练单个宽网络,还是进行内存切分——训练一个由多个较窄网络组成的集成,其总参数量相同?我们发现,对于足够大的预算,对应于最优内存切分的集成中网络数量通常大于一。有趣的是,该效应在标准架构的常用规模下也成立。例如,一个WideResNet-28-10在CIFAR-100上的测试准确率显著差于十六个较窄WideResNet的集成:分别为80.6%和82.52%。我们将所述效应称为内存切分优势,并表明其适用于多种数据集和模型架构。

关键词

引用

@article{arxiv.2005.07292,
  title  = {Deep Ensembles on a Fixed Memory Budget: One Wide Network or Several Thinner Ones?},
  author = {Nadezhda Chirkova and Ekaterina Lobacheva and Dmitry Vetrov},
  journal= {arXiv preprint arXiv:2005.07292},
  year   = {2020}
}

备注

Under review by the International Conference on Machine Learning (ICML 2020)