中文

奥卡姆梯度下降

机器学习 2025-09-04 v9

摘要

深度学习神经网络模型必须足够大以适应其问题领域,同时又要足够小以避免在梯度下降过程中对训练数据过拟合。为了平衡这些相互竞争的需求,像Transformer这样的过度配置的深度学习模型会在大型数据集上训练一个周期,因此在计算资源和训练数据方面都效率低下。针对这些低效问题,我们推导出一个可证明有效的算法,该算法可以结合任何训练和剪枝方法,同时优化效率和准确性,识别出能够抵抗过拟合并减小模型大小,同时优于底层训练算法的条件。然后,我们使用该算法将梯度下降与幅度剪枝结合为“奥卡姆梯度下降”。在损失、计算量和模型大小方面:(a) 在图像分类基准测试中,使用奥卡姆梯度下降训练的线性和卷积神经网络优于传统梯度下降(无论是否进行训练后剪枝);(b) 在一系列表格数据分类任务中,使用奥卡姆梯度下降训练的神经网络优于传统梯度下降以及随机森林;(c) 在自然语言Transformer上,奥卡姆梯度下降优于传统梯度下降。

关键词

引用

@article{arxiv.2405.20194,
  title  = {Occam Gradient Descent},
  author = {B. N. Kausik},
  journal= {arXiv preprint arXiv:2405.20194},
  year   = {2025}
}