sharpDARTS:更快更准确的可微架构搜索
计算机视觉与模式识别
2019-03-26 v1 人工智能
机器学习
摘要
神经架构搜索(NAS)一直是神经网络设计取得显著进步的源泉,最近的成果达到或超过了人工调优架构的性能。然而,我们对如何表示神经网络架构的搜索空间以及如何高效搜索该空间的理解仍处于起步阶段。我们进行了深入分析,以识别广泛使用的搜索空间和近期架构搜索方法——可微架构搜索(DARTS)中的局限性。这些发现促使我们引入了具有更通用、平衡和一致设计的新型网络块;优化得更好的余弦幂退火学习率调度;以及其他改进。由此产生的 sharpDARTS 搜索速度提高了 50%,在 CIFAR-10 上的最终模型误差相对改进了 20-30%。我们最佳的单模型运行在 CIFAR-10 上具有 1.93%(1.98+/-0.07)的验证误差,在最近发布的 CIFAR-10.1 测试集上具有 5.5%(5.8+/-0.3)的误差。据我们所知,对于相似规模的模型,两者均处于 SOTA。该模型在 ImageNet 上也具有竞争力的泛化能力,top-1 误差为 25.1%(top-5 误差为 7.8%)。我们发现了现有搜索空间的改进,但 DARTS 能否泛化到新领域?我们提出了可微超参数网格搜索和 HyperCuboid 搜索空间,这些表示旨在利用 DARTS 进行更通用的参数优化。在此我们发现,与人类一次性选择模型相比,DARTS 未能泛化。我们回顾 DARTS 和 sharpDARTS 搜索空间以理解原因,消融研究揭示了一个不寻常的泛化差距。我们最终提出 Max-W 正则化来解决此问题,其效果显著优于手工设计。代码将予以公开。
引用
@article{arxiv.1903.09900,
title = {sharpDARTS: Faster and More Accurate Differentiable Architecture Search},
author = {Andrew Hundt and Varun Jain and Gregory D. Hager},
journal= {arXiv preprint arXiv:1903.09900},
year = {2019}
}
备注
9 pages, 6 figures, 4 tables