中文

注意力偏置随机梯度下降

机器学习 2023-06-09 v5 计算机视觉与模式识别 最优化与控制 机器学习

摘要

在本文中,我们提出了一种简单而有效的可证明方法(命名为 ABSGD),用于解决深度学习中的数据不平衡或标签噪声问题。我们的方法是对动量 SGD 的简单修改,其中我们为小批量中的每个样本分配一个单独的重要性权重。采样数据的个体级权重系统地与该数据缩放损失值的指数成正比,其中缩放因子在分布鲁棒优化(DRO)框架中被解释为正则化参数。根据缩放因子为正或负,ABSGD 分别保证收敛到信息正则化 min-max 或 min-min DRO 问题的驻点。与现有的类级加权方案相比,我们的方法能够捕捉每个类内个体样本之间的多样性。与现有的使用元学习、需要三次反向传播来计算小批量随机梯度的个体级加权方法相比,我们的方法更高效,每次迭代仅需一次反向传播,如同标准深度学习方法。ABSGD 足够灵活,可与其他鲁棒损失结合而无需额外成本。我们在多个基准数据集上的实证研究表明了所提方法的有效性。\footnote{代码见:\url{https://github.com/qiqi-helloworld/ABSGD/}}

关键词

引用

@article{arxiv.2012.06951,
  title  = {Attentional-Biased Stochastic Gradient Descent},
  author = {Qi Qi and Yi Xu and Rong Jin and Wotao Yin and Tianbao Yang},
  journal= {arXiv preprint arXiv:2012.06951},
  year   = {2023}
}

备注

29 pages