中文

推进 dropout 的边界

机器学习 2018-09-28 v2 计算与语言 机器学习

摘要

我们表明 dropout 训练最好被理解为对一族条件模型同时执行 MAP 估计,这些模型的目标函数本身以下界受限于原始 dropout 目标。这一发现使我们在训练后可从该族中选取任意模型,从而在重度正则化的语言建模上带来显著提升。该族包含对采样的 dropout 掩码计算幂均值的模型,以及比完全随机 dropout 目标具有更紧且更高下界的较小随机子变体。我们论证,由于确定性子变体的界等于其目标函数且在这些模型中最高,将其视为主流观点中 MC 平均的良好近似是有误导性的。相反,确定性 dropout 是对真实目标的最佳可用近似。

关键词

引用

@article{arxiv.1805.09208,
  title  = {Pushing the bounds of dropout},
  author = {Gábor Melis and Charles Blundell and Tomáš Kočiský and Karl Moritz Hermann and Chris Dyer and Phil Blunsom},
  journal= {arXiv preprint arXiv:1805.09208},
  year   = {2018}
}