小心反向传播的内容:线性输出激活与梯度提升的案例
机器学习
2017-07-14 v1 计算机视觉与模式识别
摘要
在这项工作中,我们展示了饱和输出激活函数(如softmax)会阻碍在许多标准分类任务上的学习。此外,我们呈现的结果表明,softmax的效用并非源于归一化,正如一些人所推测的那样。事实上,归一化使情况更糟。相反,优势在于误差梯度的指数化。这种指数梯度提升被证明可以加速收敛并改善泛化。为此,我们在多种分类任务上展示了更快的收敛和更好的性能:使用CIFAR-10和ImageNet的图像分类,以及使用PASCAL VOC 2012的语义分割。在后一种情况下,使用最先进的神经网络架构,我们的方法比标准softmax激活的模型收敛速度快33%(大约少训练两天),并且性能也略好。
引用
@article{arxiv.1707.04199,
title = {Be Careful What You Backpropagate: A Case For Linear Output Activations & Gradient Boosting},
author = {Anders Oland and Aayush Bansal and Roger B. Dannenberg and Bhiksha Raj},
journal= {arXiv preprint arXiv:1707.04199},
year = {2017}
}