中文

在神经架构搜索及更广泛应用中的仅训练 BatchNorm

机器学习 2021-12-02 v1 计算机视觉与模式识别

摘要

本工作研究批归一化(BatchNorm)在神经架构搜索(NAS)中的使用。具体而言,Frankle 等人发现仅训练 BatchNorm 即可取得非平凡性能。此外,Chen 等人声称仅训练 BatchNorm 可将一次性 NAS 超网的训练加速十倍以上。关键的是,此前无人致力于理解 1)为何仅训练 BatchNorm 能以更少的超网训练时间找到性能良好的架构,以及 2)仅训练 BN 的超网与标准训练的超网有何区别。我们首先证明仅训练 BN 的网络收敛到神经正切核(neural tangent kernel)机制,并在理论上获得与全参数训练相同的训练动态。我们的证明支持了在超网上以更少训练时间仅训练 BatchNorm 的主张。随后,我们通过实验揭示仅训练 BN 的超网在卷积运算子上相对于其他算子具有优势,导致架构间的不公平竞争。这是由于仅有卷积算子附带了 BatchNorm。通过实验,我们表明这种不公平性使搜索算法倾向于选择含卷积的模型。为解决此问题,我们在搜索空间中的每个算子上都放置一个 BatchNorm 层以引入公平性。然而,我们观察到 Chen 等人中的性能预测器在新搜索空间上不适用。为此,我们提出一种新颖的复合性能指示器,从表达能力、可训练性和不确定性三个角度评估网络,其源自 BatchNorm 的理论性质。我们在多个 NAS 基准(NAS-Bench-101、NAS-Bench-201)与搜索空间(DARTS 搜索空间与 MobileNet 搜索空间)上证明了方法的有效性。

关键词

引用

@article{arxiv.2112.00265,
  title  = {Training BatchNorm Only in Neural Architecture Search and Beyond},
  author = {Yichen Zhu and Jie Du and Yuqin Zhu and Yi Wang and Zhicai Ou and Feifei Feng and Jian Tang},
  journal= {arXiv preprint arXiv:2112.00265},
  year   = {2021}
}

备注

11 pages Technical report