闭形式最后层优化
机器学习
2026-05-11 v2 机器学习
摘要
神经网络通常使用变种的随机梯度下降进行优化。然而,在平方损失下,线性最后层权重的最优解已知其闭式解。我们提出利用这一点进行优化,将最后层视为主干参数的函数,仅优化这些参数。我们证明这等价于在主干上进行梯度下降步骤,再进行最后层的闭式更新。我们为随机梯度下降的设置对该方法进行了适配,方法是在当前小批量的损失与之前小批量积累信息之间进行权衡。我们提供了理论分析,表明该方法在神经切线核范数下收敛于最优解,同时量化了与标准 SGD 在一次优化中的收益。最后,我们在多个回归任务(包括神经算子和因果推断)中Demonstrate了该方法在平方损失下的有效性,与 SGD 和 Adam 进行比较。
引用
@article{arxiv.2510.04606,
title = {Closed-Form Last Layer Optimization},
author = {Alexandre Galashov and Nathaël Da Costa and Liyuan Xu and Philipp Hennig and Arthur Gretton},
journal= {arXiv preprint arXiv:2510.04606},
year = {2026}
}