中文

NAS评估极其困难

机器学习 2020-02-17 v3 计算机视觉与模式识别 机器学习

摘要

神经架构搜索(NAS)是一个令人振奋的新领域,有望像2012年的卷积神经网络一样成为游戏规则的改变者。尽管许多优秀工作在各种任务上带来了实质性改进,不同方法之间的比较仍是一个非常开放的问题。虽然大多数算法在相同数据集上测试,但并未遵循所有方法共享的实验协议。因此,并且由于消融研究使用不足,关于某些方法为何比其他方法更有效缺乏清晰性。我们的首要贡献是在55个数据集上对88种NAS方法的基准测试。为克服比较具有不同搜索空间的方法的障碍,我们提议使用该方法相对于随机采样平均架构的相对改进,这有效消除了来自专家设计的搜索空间或训练协议的优势。令人惊讶的是,我们发现许多NAS技术难以显著击败平均架构基线。我们进一步使用常用的DARTS搜索空间进行实验,以理解NAS流水线中每个组件的贡献。这些实验凸显:(i) 评估协议中技巧的使用对架构的 reported 性能有主导性影响;(ii) 基于单元的搜索空间具有非常窄的准确率范围,以至于种子对架构排名有相当大影响;(iii) 手工设计的宏观结构(单元)比搜索的微观结构(操作)更重要;以及 (iv) 深度鸿沟是一种真实现象,由882020个单元架构之间排名的变化所证明。最后,我们建议最佳实践,希望将对社区有用并有助于缓解当前NAS的缺陷。所用代码可在 https://github.com/antoyang/NAS-Benchmark 获取。

关键词

引用

@article{arxiv.1912.12522,
  title  = {NAS evaluation is frustratingly hard},
  author = {Antoine Yang and Pedro M. Esperança and Fabio M. Carlucci},
  journal= {arXiv preprint arXiv:1912.12522},
  year   = {2020}
}

备注

Published as a conference paper at ICLR2020; 13 pages; 10 figures