GRADSTOP:基于后验采样的梯度下降早停方法
机器学习
2026-01-28 v2
摘要
机器学习模型通常通过梯度下降算法最小化训练数据上的损失函数来学习。这些模型经常遭受过拟合,导致在未见数据上的预测性能下降。标准的解决方案是使用留出验证集进行早停,即在验证损失停止下降时终止最小化过程。然而,该留出集减少了可用于训练的数据。本文提出了 GRADSTOP,一种新颖的随机早停方法,该方法仅使用梯度下降算法“免费”产生的梯度中的信息。我们的主要贡献在于:通过梯度信息估计贝叶斯后验,将早停问题定义为从该后验中抽取样本,并使用近似后验来获取停止准则。我们的实证评估表明,GRADSTOP 在测试数据上实现了较小的损失,且与基于验证集的停止准则相比表现良好。通过利用整个数据集进行训练,我们的方法在数据受限环境中(如迁移学习)尤为有利。它可以作为可选功能以极小的计算开销集成到梯度下降库中。源代码可在 https://github.com/edahelsinki/gradstop 获取。
引用
@article{arxiv.2508.19028,
title = {GRADSTOP: Early Stopping of Gradient Descent via Posterior Sampling},
author = {Arash Jamshidi and Lauri Seppäläinen and Katsiaryna Haitsiukevich and Hoang Phuc Hau Luu and Anton Björklund and Kai Puolamäki},
journal= {arXiv preprint arXiv:2508.19028},
year = {2026}
}