中文

Dropout作为交互效应的正则化器

机器学习 2021-10-19 v2 机器学习

摘要

我们从交互的视角审视Dropout。该视角提供了一种对称性来解释Dropout:给定NN个变量,存在(Nk){N \choose k}个可能的kk变量集合以形成交互(即O(Nk)\mathcal{O}(N^k));反之,一个kk变量交互在以概率pp进行Dropout时幸存的概率为(1p)k(1-p)^k(随kk衰减)。这些速率有效地相互抵消,因此Dropout对高阶交互起到正则化作用。我们从解析与经验上证明了该视角。将Dropout视为针对交互效应的正则化器这一视角具有若干实际意义:(1) 当我们需要对虚假高阶交互进行更强正则化时,应使用更高的Dropout率;(2) 在解释基于Dropout的解释与不确定性度量时应谨慎;(3) 以输入Dropout训练的网络是有偏估计量。我们还将其它正则化器与Dropout进行比较,发现难以获得针对高阶交互的相同选择压力。

关键词

引用

@article{arxiv.2007.00823,
  title  = {Dropout as a Regularizer of Interaction Effects},
  author = {Benjamin Lengerich and Eric P. Xing and Rich Caruana},
  journal= {arXiv preprint arXiv:2007.00823},
  year   = {2021}
}