一种面向深度神经网络的求解器+梯度下降训练算法
机器学习
2022-07-26 v2 计算机科学中的逻辑
摘要
我们提出一种新颖的混合算法用于训练深度神经网络,该算法将当前最先进的梯度下降(GD)方法与混合整数线性规划(MILP)求解器相结合,在回归和分类任务中,在准确率、资源效率和数据效率方面均优于GD及其变体。我们的GD+求解器混合算法称为GDSolver,其工作方式如下:给定一个深度神经网络作为输入,GDSolver调用GD对进行部分训练,直到其陷入局部极小值,此时GDSolver调用MILP求解器,在最后一层参数权重赋值周围的损失景观区域内进行穷举搜索,目标是穿越并逃离该局部极小值。重复此过程直至达到期望的准确率。在我们的实验中,我们发现GDSolver不仅能很好地扩展到更多数据和非常大的模型规模,而且在收敛速度和数据效率方面均优于所有其他竞争方法。对于回归任务,GDSolver生成的模型平均均方误差(MSE)降低31.5%,且耗时减少48%;对于MNIST和CIFAR10上的分类任务,GDSolver仅使用GD基线所需训练数据的50%,就能在所有竞争方法中达到最高准确率。
引用
@article{arxiv.2207.03264,
title = {A Solver + Gradient Descent Training Algorithm for Deep Neural Networks},
author = {Dhananjay Ashok and Vineel Nagisetty and Christopher Srinivasa and Vijay Ganesh},
journal= {arXiv preprint arXiv:2207.03264},
year = {2022}
}