中文

无需训练预测训练时间

机器学习 2020-08-31 v1 机器学习

摘要

我们解决了预测预训练深度网络收敛到给定损失函数值所需的优化步数的问题。为此,我们利用以下事实:微调期间深度网络的训练动态可由线性化模型的动态很好地近似。这使我们能够通过求解函数空间中的低维随机微分方程 (SDE) 来近似训练任意时刻的训练损失和准确率。利用该结果,我们能够在无需进行任何训练的情况下,预测随机梯度下降 (SGD) 将模型微调到给定损失所需的时间。在我们的实验中,我们能够在多种数据集和超参数下以 20% 的误差范围预测 ResNet 的训练时间,相比实际训练成本降低了 30 至 45 倍。我们还讨论了如何进一步降低我们方法的计算和内存成本,特别地,我们展示了通过利用梯度矩阵的谱性质,可以在仅处理部分样本的情况下预测大型数据集上的训练时间。

关键词

引用

@article{arxiv.2008.12478,
  title  = {Predicting Training Time Without Training},
  author = {Luca Zancato and Alessandro Achille and Avinash Ravichandran and Rahul Bhotika and Stefano Soatto},
  journal= {arXiv preprint arXiv:2008.12478},
  year   = {2020}
}