深度学习应用中的 mini-batch 二次方程去偏策略
机器学习
2025-01-29 v2 机器学习
摘要
二次近似构成机器学习方法的基本构建块。例如,二阶优化器试图找到目标函数局部二次代理的牛顿步,以实现最小值;网络损失函数的二阶近似可用于通过拉普拉斯近似来量化其输出的不确定性。当在整个训练集上进行计算难以实现时——这在深度学习中典型——相关数量在 mini-batch 上计算。这会以一种复杂的方式扭曲和偏斜相关的随机二次近似的形状,对应用程序产生不利影响。在本文中,我们(i)表明这种偏差引入了系统性误差,(ii)提供了对其的理论解释,(iii)解释其对二阶优化和通过深度学习中的拉普拉斯近似进行不确定性量化的相关性,以及(iv)开发和评估了去偏策略。
引用
@article{arxiv.2410.14325,
title = {Debiasing Mini-Batch Quadratics for Applications in Deep Learning},
author = {Lukas Tatzel and Bálint Mucsányi and Osane Hackel and Philipp Hennig},
journal= {arXiv preprint arXiv:2410.14325},
year = {2025}
}
备注
Main text (including references): 13 pages, 6 figures; Supplements: 27 pages, 16 figures