重要性加权在深度学习中的效果是什么?
机器学习
2019-06-17 v3 机器学习
摘要
重要性加权风险最小化是许多用于因果推断、域适应、类不平衡和离策强化学习的机器学习算法的关键要素。虽然对于低容量误指定模型,重要性加权的效果已被充分刻画,但人们对其如何作用于过参数化深度神经网络却知之甚少。受近期理论结果启发——该结果表明在(线性)可分数据上,经 SGD 优化的深度线性网络学习权重无关解——我们追问:对于现实深度网络(许多实际数据集是可分的),重要性加权的效果是什么?我们给出了一个令人惊讶的发现:虽然重要性加权在训练早期影响模型,但其效果在后续 epoch 中减弱。此外,虽然 L2 正则化和批归一化(而非 dropout)恢复了重要性加权的一些影响,但它们通过(看似)错误的抽象表达该效果:从业者为何应调整 L2 正则化,又该调整多少,以产生正确的加权效果?我们的实验在一系列架构和数据集上确认了这些发现。
引用
@article{arxiv.1812.03372,
title = {What is the Effect of Importance Weighting in Deep Learning?},
author = {Jonathon Byrd and Zachary C. Lipton},
journal= {arXiv preprint arXiv:1812.03372},
year = {2019}
}