中文

论 Dropout 的归纳偏置

机器学习 2017-02-21 v4 人工智能 神经与进化计算 统计理论 机器学习 统计理论

摘要

Dropout 是一种简单而有效的技术,适用于神经网络及其他场景中的学习。需要对其有坚实的理论理解,以确定何时应用 Dropout 以及如何最有效地使用它。在本文中,我们继续探索由 Wager 等人开创的作为正则化器的 Dropout。我们关注线性分类,其中最小化了误分类损失的凸代理(即逻辑回归中使用的逻辑损失)。我们证明了:(a) Dropout 正则化准则何时有唯一最小化器,(b) Dropout 正则化惩罚何时随权重趋于无穷大以及何时保持有界,(c) Dropout 正则化在单个权重从 0 增加时可能是非单调的,以及 (d) Dropout 正则化惩罚可能不是凸的。最后一点尤其令人惊讶,因为 Dropout 正则化与任何凸损失代理的组合始终是凸函数。为了对比 Dropout 正则化与 L2L_2 正则化,我们将不同数据源与不同正则化器的兼容性概念形式化。随后,我们展示了被证明比 L2L_2 正则化更兼容 Dropout 正则化的分布,反之亦然。这些来源提供了关于 Dropout 和 L2L_2 正则化的归纳偏置如何不同的额外见解。我们对 L1L_1 正则化也提供了一些类似的结果。

关键词

引用

@article{arxiv.1412.4736,
  title  = {On the Inductive Bias of Dropout},
  author = {David P. Helmbold and Philip M. Long},
  journal= {arXiv preprint arXiv:1412.4736},
  year   = {2017}
}