FP-NAS:快速概率神经架构搜索
计算机视觉与模式识别
2021-04-01 v3 机器学习
摘要
微分神经架构搜索(NAS)要求同时将所有层选择保存在内存中;这限制了搜索空间和最终架构的规模。相反,概率 NAS(如 PARSEC)学习高性能架构上的分布,并且仅使用训练单个模型所需的内存量。然而,它需要采样许多架构,这使得在广阔空间中搜索的计算代价高昂。为解决这些问题,我们提出了一种自适应于分布熵的采样方法,在开始时抽取更多样本以鼓励探索,并随着学习推进减少样本。此外,为了在多元空间中快速搜索,我们提出了一种由粗到细的策略,在开始时使用因子化分布,可将架构参数数量减少一个数量级以上。我们称此方法为快速概率 NAS(FP-NAS)。与 PARSEC 相比,它可少采样 64% 的架构并快 2.1 倍搜索。与 FBNetV2 相比,FP-NAS 快 1.9 倍至 3.5 倍,且搜索出的模型在 ImageNet 上优于 FBNetV2 模型。FP-NAS 使我们能够将巨大的 FBNetV2 空间扩展得更宽(即更大的通道选择)和更深(即更多块),同时加入 Split-Attention 块并支持对拆分数量的搜索。在搜索大小为 0.4G FLOPS 的模型时,FP-NAS 比 EfficientNet 快 132 倍,且搜索出的 FP-NAS-L0 模型准确率比 EfficientNet-B0 高 0.7%。在不使用任何架构代理或缩放技巧的情况下,我们直接搜索高达 1.0G FLOPS 的大模型。我们的 FP-NAS-L2 模型通过简单蒸馏,在使用相似 FLOPS 的情况下,比采用先进原地蒸馏的 BigNAS-XL 准确率高出 0.7%。
引用
@article{arxiv.2011.10949,
title = {FP-NAS: Fast Probabilistic Neural Architecture Search},
author = {Zhicheng Yan and Xiaoliang Dai and Peizhao Zhang and Yuandong Tian and Bichen Wu and Matt Feiszli},
journal= {arXiv preprint arXiv:2011.10949},
year = {2021}
}
备注
CVPR 2021 camera-ready version