面向高效神经网络设计的可微神经架构学习
机器学习
2021-03-04 v1
摘要
随着深度卷积神经网络(CNNs)的发展,自动化神经网络设计受到越来越多的关注,尤其是涉及其在嵌入式与移动平台上的部署时。神经架构搜索(NAS)面临的最大问题之一是,需要训练大量候选神经架构,例如使用强化学习与进化优化算法,计算代价巨大。即便近期的可微神经架构搜索(DNAS)也基于所学架构参数的概率分布采样少量候选神经架构以选定最终架构。为解决此计算复杂度问题,我们引入一种基于缩放sigmoid函数的全新\emph{架构参数化},并提出一种通用的\emph{可微神经架构学习}(DNAL)方法,可在无需评估候选神经网络的情况下优化神经架构。具体而言,针对随机超网与传统CNNs,我们构建了由缩放sigmoid函数控制架构组件的新通道级模块层。我们从头训练这些神经网络模型,将网络优化解耦为权重优化与架构优化。我们通过具有收敛保证的连续缩放sigmoid方法解决神经架构的非凸优化问题。大量实验表明,我们的DNAL方法在神经架构搜索代价方面具有优越性能。DNAL所学最优网络在基准CIFAR-10与ImageNet-1K数据集上的准确率、模型规模与计算复杂度均超越当前最优方法所得网络。
引用
@article{arxiv.2103.02126,
title = {Differentiable Neural Architecture Learning for Efficient Neural Network Design},
author = {Qingbei Guo and Xiao-Jun Wu and Josef Kittler and Zhiquan Feng},
journal= {arXiv preprint arXiv:2103.02126},
year = {2021}
}
备注
10 pages, 8 figures, 53 conferences