中文

梯度下降在可分离多类数据上的隐式偏差

机器学习 2024-11-08 v2 机器学习

摘要

隐式偏差描述了基于优化的训练算法在没有显式正则化的情况下,即使更复杂的估计量具有同等目标值,也倾向于简单估计量的现象。多项研究在假设损失满足指数尾部性质的条件下,发展了二分类隐式偏差的理论。然而,多类分类的分析存在明显空白,仅有少数结果且这些结果本身仅限于交叉熵损失。在本工作中,我们采用置换等变且基于相对边距(PERM)损失的框架 [Wang and Scott, 2024],引入多类扩展的指数尾部性质。该类损失不仅包括交叉熵,还包括其他损失。利用该框架,我们将 Soudry 等人 [2018] 的隐式偏差结果扩展到多类分类。此外,我们的证明技术与二分类情况高度一致,从而展示了 PERM 框架在弥合二分类与多分类之间差距的能力。

关键词

引用

@article{arxiv.2411.01350,
  title  = {The Implicit Bias of Gradient Descent on Separable Multiclass Data},
  author = {Hrithik Ravi and Clayton Scott and Daniel Soudry and Yutong Wang},
  journal= {arXiv preprint arXiv:2411.01350},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024