基于损失梯度高斯宽度的泛化与优化保证
机器学习
2025-03-12 v2
摘要
population loss 上的泛化与优化保证通常依赖于基于 Rademacher 复杂度的统一收敛分析,现代模型的强大表示能力导致人们对这种方法产生担忧。本文提出以损失梯度复杂度(即 Loss Gradient Gaussian Width, LGGW)为基础的泛化与优化保证。首先,在灵活的梯度支配条件下,我们直接以 LGGW 为度量给出泛化保证,该条件将 POLYAK-ŁOJASIEWICZ (PL) 条件作为特殊情况。其次,我们表明,在 LGGW 较小的前提下,迭代梯度下降中的样本重复使用不会导致经验梯度偏离 population 梯度。最后,针对深度网络,我们将其单样本 LGGW 界定为 featurizer(即倒数第二层输出)的高斯宽度。到目前为止,我们所知关于 LGGW 的泛化与优化保证是首次提出的,为深入模型提供了相当大的希望,以实现更精确的界。
关键词
引用
@article{arxiv.2406.07712,
title = {Loss Gradient Gaussian Width based Generalization and Optimization Guarantees},
author = {Arindam Banerjee and Qiaobo Li and Yingxue Zhou},
journal= {arXiv preprint arXiv:2406.07712},
year = {2025}
}