Newton Losses:利用曲率信息进行可微算法学习
机器学习
2024-10-28 v1
摘要
在使用自定义目标函数(如排序损失和最短路径损失)训练神经网络时,常见问题是它们本身是非可微的。流行的方法是持续松弛目标函数以提供梯度,从而实现学习。然而,这些可微松弛常常是非凸的,并且可能出现梯度消失和爆炸,使其(即使孤立存在)难以优化。在这里,损失函数是训练深度神经网络的瓶颈。我们提出 Newton Losses,这是一种通过利用其经验 Fisher 矩阵和 Hessian 矩阵的二阶信息来改进现有难以优化损失函数性能的方法。我们不通过二阶技术训练神经网络,而仅利用损失函数的二阶信息将其替换为 Newton Loss,同时使用梯度下降训练网络。这使得我们的方法在计算上具有效率优势。我们将 Newton Losses 应用于八种用于排序和最短路径的可微算法,针对较少优化的可微算法实现了显著改进,并即使针对已优化的可微算法也实现了持续的改进。
引用
@article{arxiv.2410.19055,
title = {Newton Losses: Using Curvature Information for Learning with Differentiable Algorithms},
author = {Felix Petersen and Christian Borgelt and Tobias Sutter and Hilde Kuehne and Oliver Deussen and Stefano Ermon},
journal= {arXiv preprint arXiv:2410.19055},
year = {2024}
}
备注
Published at NeurIPS 2024