无需训练的神经网络架构搜索
机器学习
2021-06-14 v3 计算机视觉与模式识别
机器学习
摘要
手工设计深度神经网络所耗费的时间与精力巨大,这促使了神经网络架构搜索(NAS)技术的发展以自动化该设计过程。然而,NAS 算法往往缓慢且昂贵;它们需要训练大量候选网络来指导搜索过程。若能从网络的初始状态部分预测其训练后准确率,则可缓解此问题。本工作中,我们考察了未训练网络中数据点间激活的重叠现象,并阐明其如何提供一种对网络训练后性能具有有用指示作用的度量。我们将该度量纳入一个简单算法,使其能在单块 GPU 上于数秒内无需任何训练即可搜索出强大的网络,并在 NAS-Bench-101、NAS-Bench-201、NATS-Bench 和 Network Design Spaces 上验证其有效性。我们的方法可轻易与更昂贵的搜索方法结合;我们考察了正则化进化搜索的一种简单适配。复现我们实验的代码见 https://github.com/BayesWatch/nas-without-training。
引用
@article{arxiv.2006.04647,
title = {Neural Architecture Search without Training},
author = {Joseph Mellor and Jack Turner and Amos Storkey and Elliot J. Crowley},
journal= {arXiv preprint arXiv:2006.04647},
year = {2021}
}
备注
Accepted at ICML 2021 for a long presentation