中文

微小温度即可满足可微架构搜索之需

机器学习 2023-06-13 v1

摘要

可微架构搜索(DARTS)通过将离散操作选择松弛为优化连续架构参数,将 NAS 从离散优化映射到连续问题,从而实现高效的基于梯度的神经架构搜索(NAS)。DARTS 随后通过一次性搜索后剪枝将松弛的超网重新映射回离散空间,以获得最终架构(finalnet)。一些新兴工作认为,这种重映射本质上容易导致训练与评估之间的网络不匹配,从而造成性能差异,甚至在极端情况下模型崩溃。我们提出通过在训练阶段利用微小温度稀疏化连续分布,以缩小训练中的松弛超网与评估中的剪枝 finalnet 之间的差距。为此,我们首先形式化稀疏噪声 softmax 以避免梯度饱和。然后我们提出指数温度调度以更好地控制外推分布,并精心设计基于熵的自适应方案以最终达成增强。我们进行了大量实验来验证我们方法的效率与有效性。

关键词

引用

@article{arxiv.2306.06855,
  title  = {Small Temperature is All You Need for Differentiable Architecture Search},
  author = {Jiuling Zhang and Zhiming Ding},
  journal= {arXiv preprint arXiv:2306.06855},
  year   = {2023}
}

备注

Accepted for PAKDD 2023