中文

小心反向传播的内容:线性输出激活与梯度提升的案例

机器学习 2017-07-14 v1 计算机视觉与模式识别

摘要

在这项工作中,我们展示了饱和输出激活函数(如softmax)会阻碍在许多标准分类任务上的学习。此外,我们呈现的结果表明,softmax的效用并非源于归一化,正如一些人所推测的那样。事实上,归一化使情况更糟。相反,优势在于误差梯度的指数化。这种指数梯度提升被证明可以加速收敛并改善泛化。为此,我们在多种分类任务上展示了更快的收敛和更好的性能:使用CIFAR-10和ImageNet的图像分类,以及使用PASCAL VOC 2012的语义分割。在后一种情况下,使用最先进的神经网络架构,我们的方法比标准softmax激活的模型收敛速度快33%(大约少训练两天),并且性能也略好。

关键词

引用

@article{arxiv.1707.04199,
  title  = {Be Careful What You Backpropagate: A Case For Linear Output Activations & Gradient Boosting},
  author = {Anders Oland and Aayush Bansal and Roger B. Dannenberg and Bhiksha Raj},
  journal= {arXiv preprint arXiv:1707.04199},
  year   = {2017}
}