梯度下降沿正则化路径收敛于一般损失函数
机器学习
2020-06-22 v1 最优化与控制
机器学习
摘要
近期许多机器学习领域的研究都强调,标准的下降方法即使没有显式正则化,也不仅仅最小化训练误差,还表现出一种隐式偏置。这种偏置通常朝向某种正则化解,并依赖于学习过程的细节,例如交叉熵损失的使用。在本工作中,我们证明,对于使用任意凸的、严格递减损失的线性预测器上的经验风险最小化,若风险未达到其下确界,则梯度下降路径与独立于算法的正则化路径收敛到同一方向(只要其中任一路径收敛到某方向)。利用该结果,我们为广泛使用的指数尾损失(如指数损失或逻辑损失)提供了合理性解释:虽然指数尾损失向某方向的收敛必然朝向最大间隔方向,但其他损失如多项式尾损失可能导致向具有较差间隔的方向收敛。
引用
@article{arxiv.2006.11226,
title = {Gradient descent follows the regularization path for general losses},
author = {Ziwei Ji and Miroslav Dudík and Robert E. Schapire and Matus Telgarsky},
journal= {arXiv preprint arXiv:2006.11226},
year = {2020}
}
备注
To appear, COLT 2020