中文

通过原-对偶分析刻画隐式偏差

机器学习 2020-11-13 v3 最优化与控制 机器学习

摘要

本文证明,即使对于一般损失函数,梯度下降在线性可分数据上的隐式偏差也恰好由一个平滑间隔给出的对偶优化问题的最优解所刻画。这与先前通常针对指数尾损失函数量身定制的结果形成对比。特别地,对于指数损失,在 nn 个训练样本和 tt 步梯度下降的情况下,我们的对偶分析进一步使我们能够证明,当使用恒定步长时,收敛到 2\ell_2 最大间隔方向的速率为 O(ln(n)/ln(t))O(\ln(n)/\ln(t))。该速率在 nntt 上都是紧的,这是先前工作未曾给出的。另一方面,通过适当选择但激进的步长方案,我们证明了 2\ell_2 间隔最大化和隐式偏差的 O(1/t)O(1/t) 速率,而先前工作(包括针对一般硬间隔线性 SVM 问题的所有一阶方法)证明的间隔速率为 O~(1/t)\widetilde{O}(1/\sqrt{t}),或收敛到次优间隔的 O(1/t)O(1/t) 间隔速率,并伴随一个隐含的(更慢的)偏差速率。我们的关键观察包括:在原变量上的梯度下降自然地诱导了对偶变量上的镜像下降更新,并且该设定下的对偶目标足够平滑,从而能给出更快的速率。

关键词

引用

@article{arxiv.1906.04540,
  title  = {Characterizing the implicit bias via a primal-dual analysis},
  author = {Ziwei Ji and Matus Telgarsky},
  journal= {arXiv preprint arXiv:1906.04540},
  year   = {2020}
}