微小温度即可满足可微架构搜索之需
机器学习
2023-06-13 v1
摘要
可微架构搜索(DARTS)通过将离散操作选择松弛为优化连续架构参数,将 NAS 从离散优化映射到连续问题,从而实现高效的基于梯度的神经架构搜索(NAS)。DARTS 随后通过一次性搜索后剪枝将松弛的超网重新映射回离散空间,以获得最终架构(finalnet)。一些新兴工作认为,这种重映射本质上容易导致训练与评估之间的网络不匹配,从而造成性能差异,甚至在极端情况下模型崩溃。我们提出通过在训练阶段利用微小温度稀疏化连续分布,以缩小训练中的松弛超网与评估中的剪枝 finalnet 之间的差距。为此,我们首先形式化稀疏噪声 softmax 以避免梯度饱和。然后我们提出指数温度调度以更好地控制外推分布,并精心设计基于熵的自适应方案以最终达成增强。我们进行了大量实验来验证我们方法的效率与有效性。
引用
@article{arxiv.2306.06855,
title = {Small Temperature is All You Need for Differentiable Architecture Search},
author = {Jiuling Zhang and Zhiming Ding},
journal= {arXiv preprint arXiv:2306.06855},
year = {2023}
}
备注
Accepted for PAKDD 2023