铰链损失下同伦梯度下降的偏差
机器学习
2019-07-30 v1 机器学习
摘要
梯度下降是一种简单且广泛使用的机器学习优化方法。对于应用于可分离数据的齐次线性分类器,已有研究表明,对于各种光滑损失函数,梯度下降会收敛到最大间隔(或等价地,最小范数)解。然而,先前的理论并不适用于实践中广泛使用的非光滑函数,如铰链损失。在此,我们研究应用于铰链损失的同伦变体梯度下降的收敛性,并给出对线性可分离数据收敛到最大间隔解的显式收敛速率。
引用
@article{arxiv.1907.11746,
title = {Bias of Homotopic Gradient Descent for the Hinge Loss},
author = {Denali Molitor and Deanna Needell and Rachel Ward},
journal= {arXiv preprint arXiv:1907.11746},
year = {2019}
}