中文

Noisy Softmax:通过推迟早期 Softmax 饱和提升 DCNN 的泛化能力

计算机视觉与模式识别 2017-08-15 v1

摘要

在过去几年中,softmax 和 SGD 分别成为 CNN 框架中常用的组件和默认的训练策略。然而,在使用 SGD 优化 CNN 时,softmax 背后的饱和行为总是给我们一种训练良好的错觉,进而被忽略。在本文中,我们首先强调 softmax 的早期饱和行为会阻碍 SGD 的探索,这有时是模型收敛于糟糕的局部极小值的原因,然后提出 Noisy Softmax,通过在每次迭代期间向 softmax 中注入退火噪声来缓解这一早期饱和问题。这种基于噪声注入的操作旨在推迟早期饱和,并进一步带来持续的梯度传播,从而显著鼓励 SGD 求解器进行更多探索,并帮助找到更好的局部极小值。本文从经验上验证了早期 softmax 去饱和的优越性,并且我们的方法确实通过正则化提高了 CNN 模型的泛化能力。我们通过实验发现,这种早期去饱和在许多任务中有助于优化,在几个流行的基准数据集上取得了 SOTA 或具有竞争力的结果。

关键词

引用

@article{arxiv.1708.03769,
  title  = {Noisy Softmax: Improving the Generalization Ability of DCNN via Postponing the Early Softmax Saturation},
  author = {Binghui Chen and Weihong Deng and Junping Du},
  journal= {arXiv preprint arXiv:1708.03769},
  year   = {2017}
}

备注

10 pages, 7 figures, CVPR2017