蒸馏最优神经网络:在多样空间中的快速搜索
机器学习
2021-08-30 v3 人工智能
计算机视觉与模式识别
神经与进化计算
机器学习
摘要
当前最先进的神经架构搜索(NAS)方法既不能高效扩展到多个硬件平台,也无法处理多样的架构搜索空间。为此,我们提出 DONNA(Distilling Optimal Neural Network Architectures,蒸馏最优神经网络架构),一种用于快速、可扩展且多样的 NAS 的新型流水线,可扩展到许多用户场景。DONNA 包含三个阶段。首先,利用来自参考模型的块级知识蒸馏构建精度预测器。该预测器支持跨具有不同宏观架构参数(如层类型和注意力机制)以及微观架构参数(如块重复次数和扩展率)的多样网络进行搜索。其次,快速进化搜索利用精度预测器和设备端测量为任意场景找到一组帕累托最优架构。第三,最优模型被快速微调至从头训练精度。DONNA 在设备端寻找最先进架构方面比 MNasNet 快多达 100 倍。在 ImageNet 分类上,DONNA 架构在 Nvidia V100 GPU 上比 EfficientNet-B0 和 MobileNetV2 快 20%,在三星 S20 智能手机上比 MobileNetV2-1.4x 快 10% 且精度高 0.5%。除 NAS 外,DONNA 还用于搜索空间扩展与探索,以及硬件感知模型压缩。
引用
@article{arxiv.2012.08859,
title = {Distilling Optimal Neural Networks: Rapid Search in Diverse Spaces},
author = {Bert Moons and Parham Noorzad and Andrii Skliar and Giovanni Mariani and Dushyant Mehta and Chris Lott and Tijmen Blankevoort},
journal= {arXiv preprint arXiv:2012.08859},
year = {2021}
}
备注
Accepted at ICCV2021. Main text 9 pages, Full text 21 pages, 18 figures