以弱预测器实现更强NAS
机器学习
2021-11-04 v3 计算机视觉与模式识别
机器学习
摘要
神经架构搜索(NAS)通常训练和评估大量架构。近期基于预测器的NAS方法试图通过两个关键步骤来缓解此类沉重计算成本:采样部分架构-性能对并拟合一个代理精度预测器。在有限样本下,由于难以拟合巨大搜索空间,这些预测器远不足以准确定位顶级架构。本文反思了一个简单却关键的问题:若我们的最终目标是找到最佳架构,是否真的需要很好地建模整个空间?我们提出一种范式转变:从使用一个强预测器拟合整个架构空间,转向通过一组较弱的预测器逐步拟合通向高性能子空间的搜索路径。作为弱预测器的一个关键属性,其采样到更优架构的概率持续增加。因此,我们仅在前一学习到的预测器引导下采样少量高性能架构,并估计一个新的更优弱预测器。这一极其简易的框架称为WeakNAS,产生由粗到细的迭代以逐步精炼采样空间的排序。大量实验表明,WeakNAS在NAS-Bench-101和NAS-Bench-201上以更少样本找到顶级性能架构。与最先进的(SOTA)基于预测器的NAS方法相比,WeakNAS以显著优势超越所有方法,例如在NAS-Bench-101上找到全局最优所需样本至少减少7.5倍。WeakNAS也可吸收它们的思想以进一步提升性能。此外,WeakNAS在ImageNet MobileNet搜索空间中取得了81.3%的新SOTA结果。代码见https://github.com/VITA-Group/WeakNAS。
引用
@article{arxiv.2102.10490,
title = {Stronger NAS with Weaker Predictors},
author = {Junru Wu and Xiyang Dai and Dongdong Chen and Yinpeng Chen and Mengchen Liu and Ye Yu and Zhangyang Wang and Zicheng Liu and Mei Chen and Lu Yuan},
journal= {arXiv preprint arXiv:2102.10490},
year = {2021}
}
备注
Accepted at NeurIPS 2021