中文

四 GPU 小时内在 ImageNet 上完成神经架构搜索:一种理论启发的视角

计算机视觉与模式识别 2021-03-17 v4 机器学习

摘要

神经架构搜索(NAS)已被大量研究以自动化发现性能优异的神经网络。现有工作需要对超网进行大量训练或密集的架构评估,因此存在资源消耗大以及常因截断训练或近似而引入搜索偏置的问题。我们能否在不涉及任何训练的情况下选出最佳神经架构,并大幅削减搜索成本?我们给出了肯定答案,提出了一种称为无训练神经架构搜索(TE-NAS)的新框架。TE-NAS通过分析神经正切核(NTK)的谱和输入空间中线性区域的数量来对架构排序。这两者都受深度网络近期理论进展的启发,且无需任何训练和任何标签即可计算。我们表明:(1)这两种度量隐含了神经网络的可训练性与表达能力;(2)它们与网络测试精度强相关。进一步,我们设计了一种基于剪枝的NAS机制,以在搜索过程中实现可训练性与表达能力之间更灵活且更优的权衡。在NAS-Bench-201和DARTS搜索空间中,TE-NAS分别仅在CIFAR-10和ImageNet上使用一块1080Ti耗时0.5和4 GPU小时即完成了高质量搜索。我们希望我们的工作能启发更多将深度网络理论发现与实际NAS应用影响相桥接的尝试。代码见:https://github.com/VITA-Group/TENAS。

关键词

引用

@article{arxiv.2102.11535,
  title  = {Neural Architecture Search on ImageNet in Four GPU Hours: A Theoretically Inspired Perspective},
  author = {Wuyang Chen and Xinyu Gong and Zhangyang Wang},
  journal= {arXiv preprint arXiv:2102.11535},
  year   = {2021}
}

备注

accepted as ICLR 2021 poster