面向高效神经架构搜索的多项分布学习
机器学习
2019-08-15 v3 计算机视觉与模式识别
神经与进化计算
摘要
通过神经架构搜索(NAS)获得的架构在各种计算机视觉任务中取得了极具竞争力的性能。然而,深度神经网络中前向-反向传播与搜索算法的高昂计算需求使得NAS难以实际应用。本文提出一种用于极高效NAS的多项分布学习,其将搜索空间视为联合多项分布,即两节点间的操作从该分布中采样,最优网络结构由该分布中概率最大的操作获得。因此,NAS可转化为多项分布学习问题,即优化该分布使其性能期望较高。此外,提出并论证了每一训练轮次中性能排序一致的假设,以进一步加速学习过程。在CIFAR10与ImageNet上的实验证明了方法的有效性。在CIFAR-10上,我们的方法搜索所得结构测试误差为2.55%,同时比最先进NAS算法快6.0倍(在GTX1080Ti上仅4 GPU小时)。在ImageNet上,我们的模型在MobileNet设置(MobileNet V1/V2)下取得75.2%的top1准确率,同时实测GPU延迟快1.2倍。带预训练模型的测试代码见 https://github.com/tanglang96/MDENAS
引用
@article{arxiv.1905.07529,
title = {Multinomial Distribution Learning for Effective Neural Architecture Search},
author = {Xiawu Zheng and Rongrong Ji and Lang Tang and Baochang Zhang and Jianzhuang Liu and Qi Tian},
journal= {arXiv preprint arXiv:1905.07529},
year = {2019}
}