中文

基于模拟退火的嵌入式超参数调优

机器学习 2019-06-05 v1 人工智能 离散数学 最优化与控制 机器学习

摘要

我们提出一种新的元启发式训练方案,以非传统方式结合随机梯度下降(SGD)与离散优化。我们的思路是定义当前 SGD 点的一个离散邻域,其中包含若干利用梯度信息的“潜在优移”,并使用借自离散优化的经典元启发式方案来搜索该邻域。在本文中,我们研究一种简单的模拟退火(SA)元启发式的使用,它以依赖于新解质量以及一个参数(温度)的概率接受/拒绝邻域中的候选新解,该参数随时间修改以降低接受恶化移动的概率。我们将此方案用作执行超参数调优的自动方法,故得本文标题。我们方案的一个显著特征是超参数在单次 SGD 执行中被修改(而非如惯例般在外部循环中)并即时在当前小批量上评估,即其调优完全嵌入于 SGD 算法中。将 SA 用于训练并非新事,但先前提案主要针对不可微目标函数,因缺乏梯度而不应用 SGD。相反,我们的 SA 方法要求(代理)损失函数的可微性,并利用梯度方向的可用性来定义具有较大概率改进当前解的局部移动。我们报告了在图像分类(CIFAR-10)上的计算结果,表明所提方法提升了 ResNet34 和 VGG16 等现代深度神经网络的最终验证准确率。

关键词

引用

@article{arxiv.1906.01504,
  title  = {Embedded hyper-parameter tuning by Simulated Annealing},
  author = {Matteo Fischetti and Matteo Stringher},
  journal= {arXiv preprint arXiv:1906.01504},
  year   = {2019}
}