中文

大间隔 Softmax 中概率依赖的梯度衰减

机器学习 2023-10-10 v2 人工智能 机器学习

摘要

过去几年,Softmax 已成为神经网络框架中的常见组件。本文在 Softmax 中引入梯度衰减超参数,以控制训练期间概率依赖的梯度衰减率。基于在 MNIST、CIFAR-10/100 与 SVHN 上训练多种模型架构的理论分析与经验结果,我们发现泛化性能显著依赖于随置信概率上升的梯度衰减率,即梯度随样本概率增加呈凸性或凹性下降。此外,小梯度衰减的优化展现出类似课程学习的序列,其中难样本仅在易样本被充分说服后才成为焦点,且分离良好的样本获得更高梯度以减小类内距离。基于分析结果,我们可提供证据:大间隔 Softmax 将通过调节概率依赖的梯度衰减率影响损失函数的局部 Lipschitz 约束。本文通过分析梯度衰减率,提供了关于大间隔 Softmax、局部 Lipschitz 约束与课程学习概念间关系的新视角与理解。此外,我们提出一种预热策略以在训练中动态调整 Softmax 损失,其梯度衰减率从过小增至加快收敛速度。

关键词

引用

@article{arxiv.2210.17145,
  title  = {Probability-Dependent Gradient Decay in Large Margin Softmax},
  author = {Siyuan Zhang and Linbo Xie and Ying Chen},
  journal= {arXiv preprint arXiv:2210.17145},
  year   = {2023}
}