用于微分架构搜索的单层优化
机器学习
2020-12-22 v1
摘要
在本文中,我们指出微分架构搜索(DARTS)使得网络权重的架构参数梯度有偏,且架构参数在双层优化框架中于不同数据集上交替更新。该偏差导致不可学习操作的架构参数超过可学习操作。此外,使用 softmax 作为架构参数的激活函数以及不适当的学习率会加剧该偏差。结果,在搜索阶段频繁观察到不可学习操作占主导。为减小偏差,我们提出用单层优化替代双层优化,并用 sigmoid 等非竞争激活函数替代 softmax。因此,我们可以稳定地搜索高性能架构。在 NAS Benchmark 201 上的实验验证了我们的假设,并稳定地找出了近乎最优的架构。在 DARTS 空间上,我们搜索出在 ImageNet-1K 上 top1 准确率为 77.0%(训练设置遵循 PDARTS 且不含任何附加模块)的当前最优架构,并稳定搜索出 top1 准确率高达 76.5% 的架构(但未从搜索出的架构中挑选最佳),这与当前报道的最佳结果相当。
引用
@article{arxiv.2012.11337,
title = {Single-level Optimization For Differential Architecture Search},
author = {Pengfei Hou and Ying Jin},
journal= {arXiv preprint arXiv:2012.11337},
year = {2020}
}