中文

自然梯度下降比随机梯度下降收敛到更不简并的解

机器学习 2024-09-16 v2 机器学习

摘要

模型的自由参数数量或维度是衡量其复杂性的直接方法:参数更多的模型可以编码更多信息。然而,这并不是复杂性的准确度量:能够记忆训练数据的模型尽管维度很高,但通常泛化良好。有效维度旨在通过仅计数表示模型功能所需的参数数量来更直接地捕捉模型的复杂性。奇异学习理论提出学习系数λ\lambda作为有效维度的更准确度量。通过描述损失函数关于参数空间局部最小值附近区域体积的增加速率,λ\lambda包含了来自高阶项的信息。我们比较了使用自然梯度下降和随机梯度下降训练的模型的λ\lambda,发现使用自然梯度下降训练的模型在我们的两种方法(Hessian迹Tr(H)\text{Tr}(\mathbf{H})和局部学习系数的估计λ^(w)\hat{\lambda}(w^*))中始终具有更高的有效维度。

关键词

引用

@article{arxiv.2409.04913,
  title  = {NGD converges to less degenerate solutions than SGD},
  author = {Moosa Saghir and N. R. Raghavendra and Zihe Liu and Evan Ryan Gunter},
  journal= {arXiv preprint arXiv:2409.04913},
  year   = {2024}
}

备注

8 pages, 23 figures