中文

基于梯度匹配的少样本神经架构搜索泛化

计算机视觉与模式识别 2022-04-06 v2 机器学习

摘要

对从大型搜索空间中抽取出的架构进行高效性能估计,对神经架构搜索(Neural Architecture Search)至关重要。One-Shot 方法通过训练一个超网(supernet),借助权重共享来近似搜索空间中每个架构的性能,从而大幅降低搜索成本。然而,由于权重共享导致的子架构间耦合优化,One-Shot 超网的性能估计可能不准确,致使搜索结果退化。为解决该问题,Few-Shot NAS 通过边级(层级的)穷举划分,将 One-Shot 超网拆分为多个分离的子超网,从而降低权重共享程度。由于超网的每个划分并非同等重要,因此需要设计更有效的划分准则。本工作中,我们提出一种梯度匹配分数(GM),利用共享权重处的梯度信息来做出明智的划分决策。直观上,来自不同子模型的梯度可用于判断它们对如何更新共享模块是否达成一致,进而决定它们是否应共享同一权重。与穷举划分相比,所提准则显著降低了每条边的分支因子。这使得我们在给定预算下可划分更多边(层),由于 NAS 搜索空间通常包含数十条边(层),因而带来大幅改善的性能。在广泛搜索空间(NASBench-201、DARTS、MobileNet Space)、数据集(cifar10、cifar100、ImageNet)和搜索算法(DARTS、SNAS、RSPS、ProxylessNAS、OFA)上的大量实证评估表明,该方法显著优于其 Few-Shot 同类方法,同时在所得架构的精度上超越以往可比方法。

关键词

引用

@article{arxiv.2203.15207,
  title  = {Generalizing Few-Shot NAS with Gradient Matching},
  author = {Shoukang Hu and Ruochen Wang and Lanqing Hong and Zhenguo Li and Cho-Jui Hsieh and Jiashi Feng},
  journal= {arXiv preprint arXiv:2203.15207},
  year   = {2022}
}

备注

Accepted by ICLR2022