中文

神经架构搜索中干扰的分析与缓解

计算与语言 2022-07-25 v3 机器学习

摘要

权重共享是一种通过重用先前训练的子模型共享算子的权重来降低神经架构搜索(NAS)成本的流行方法。然而,由于权重共享引起的不同子模型之间的干扰,这些子模型的估计精度与真实精度的秩相关性较低。在本文中,我们通过采样不同的子模型并计算共享算子的梯度相似性来研究干扰问题,并观察到:1)两个子模型之间在共享算子上的干扰与不同算子的数量正相关;2)当共享算子的输入和输出更相似时,干扰更小。受这两个观察的启发,我们提出了两种缓解干扰的方法:1)MAGIC-T:不是随机采样子模型进行优化,我们提出一种渐进修改方案,在相邻优化步骤之间修改一个算子,以最小化共享算子上的干扰;2)MAGIC-A:强制所有子模型中该算子的输入和输出相似,以减少干扰。在 BERT 搜索空间上的实验验证了通过我们提出的每种方法缓解干扰都提高了 super-pet 的秩相关性,并且结合两种方法可以取得更好的结果。我们发现的架构在 GLUE 基准的 dev 和 test 集上分别比 RoBERTabase_{\rm base} 高出 1.1 和 0.6 个点,比 ELECTRAbase_{\rm base} 高出 1.6 和 1.1 个点。在 BERT 压缩、阅读理解和 ImageNet 任务上的大量结果证明了我们提出方法的有效性和通用性。

关键词

引用

@article{arxiv.2108.12821,
  title  = {Analyzing and Mitigating Interference in Neural Architecture Search},
  author = {Jin Xu and Xu Tan and Kaitao Song and Renqian Luo and Yichong Leng and Tao Qin and Tie-Yan Liu and Jian Li},
  journal= {arXiv preprint arXiv:2108.12821},
  year   = {2022}
}

备注

ICML 2022, Spotlight